제미나이 3.8 라이브, 말하면서 생각하는 음성 AI
구글이 9월 15일 실시간 대화 모델 제미나이 3.8 라이브와 3.8 라이브 익스텐디드 씽킹(Extended Thinking)을 발표했습니다. 3.8 라이브는 비용 효율과 확장성에 초점을 맞춰 거의 실시간으로 영상 입력을 이해하고, 97개 언어를 지원하며 대화 도중 언어가 바뀌어도 알아차리고, 대화를 끊지 않은 채 백그라운드에서 도구와 API를 호출합니다. 익스텐디드 씽킹은 복잡한 작업을 위해 추론과 발화를 동시에 진행하며, “확인해 볼게요” 같은 짧은 응답을 먼저 건넨 뒤 여러 단계 작업의 진행 상황을 말로 알려 줍니다. 구글은 Speech to Speech Quality Index 82.6점(1위), τ-Voice 에이전트 과제 완수율 68.6%, Big Bench Audio 97.7% 등의 수치를 제시했습니다.
"이 모델들은 대화를 끊지 않고도 복잡한 추론과 실시간 시각 맥락, 백그라운드 작업 실행을 처리한다."Google Blog
왜 중요한가
지금까지 음성 AI의 가장 큰 약점은 ‘생각하는 동안의 침묵’이었습니다. 음성 인식, 텍스트 추론, 음성 합성을 이어 붙인 구조에서는 무언가를 조회하거나 계산하는 순간 대화가 멈췄고, 사용자는 그 침묵을 고장으로 받아들였습니다. 추론과 발화, 도구 호출을 한 모델 안에서 동시에 돌린다는 것은 음성 인터페이스가 단순 질의응답을 넘어 예약·조회·변경 같은 실제 업무를 처리하는 에이전트로 넘어간다는 신호입니다. 일반 사용자는 Search Live와 Gemini Live에서, 개발자는 Gemini API와 Google AI Studio에서 바로 쓸 수 있고, 기업용 Gemini Enterprise에는 비공개 프리뷰로 들어갑니다.
실무 적용
웹사이트의 상담 챗봇이나 전화 응대를 기획하고 있다면, 이제 설계 단위는 ‘화면’이 아니라 ‘대화의 흐름’이 됩니다. 도구 호출이 걸리는 시간 동안 무엇을 말할지, 작업이 실패했을 때 어떻게 알리고 되돌릴지, 결제나 개인정보 변경처럼 되돌리기 어려운 단계에서 어디에 명시적 확인을 둘지를 먼저 정해야 합니다. 97개 언어 자동 전환은 다국어 고객 응대의 진입 장벽을 크게 낮추지만, 업종별 용어와 고유명사는 실제 녹취로 품질을 따로 검증하는 편이 안전합니다.
교차 참고
- Google Blog: Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe — 개발자 관점의 발표로, 두 라이브 모델과 함께 85개 이상 언어를 지원하는 음성-텍스트 전용 모델 3.5 Transcribe를 소개합니다.
- Hugging Face: One sandbox per rollout, or how labs run RL for agents in 2026 — 에이전트 학습의 어려움이 모델에서 ‘환경’으로 옮겨 갔다며, 시도마다 격리된 샌드박스를 두는 최신 강화학습 인프라를 정리합니다.
Wemeet의 관점
Wemeet은 음성 에이전트의 승부처가 모델 점수가 아니라 ‘기다림을 어떻게 디자인하느냐’에 있다고 봅니다 — 사람 상담원이 “잠시만요, 확인해 드릴게요”라고 말하는 순간이 신뢰를 만들듯, AI도 진행 상황을 말로 보여 줄 때 비로소 믿고 맡길 수 있습니다. 앞으로 홈페이지의 문의 채널은 텍스트 폼과 음성 대화가 함께 가는 구조가 될 가능성이 높고, 그만큼 대화 시나리오와 예외 처리를 설계하는 일이 제작의 새로운 핵심 역량이 될 것입니다.
이 글은 아래 원문을 바탕으로 Wemeet이 한국어로 요약·정리한 큐레이션입니다.
원문 보기 — Google Blog ↗