표정까지 실시간 — 제미나이 3.8 라이브 아바타 출시
구글이 9월 24일 "Gemini 3.8 Live with Live Avatar"를 발표했다. 음성 대화에 준실시간 영상 생성을 결합해, 대화하는 상대의 얼굴과 표정이 화면에 함께 나타나는 형태다. 제미나이 엔터프라이즈에서 정식 출시(GA)됐고, 97개 언어에서 립싱크가 맞물리며 대화 중 언어를 바꿔도 이어진다. 참조 이미지로 아바타를 직접 만들 수 있고, 생성된 영상에는 SynthID 워터마크가 들어간다.
"제미나이의 대화형 AI에 준실시간 시각적 현존감을 더한다."Google Blog
왜 중요한가
주목할 부분은 아바타의 외형보다 대화 운영 방식이다. 도구 호출을 백그라운드에서 비동기로 처리해, 데이터를 조회하는 동안에도 대화가 끊기지 않는다. 음성 AI의 최대 약점이던 "처리 중 침묵"을 구조적으로 덮는 설계다. 시각·음성 입력을 동시에 받아 자연스러운 발화 순서 교대까지 다루기 시작했다는 점에서, 상담·교육 같은 대면형 업무가 첫 적용 대상이 될 가능성이 크다.
실무 적용
웹·앱에 도입한다면 아바타를 전면에 세우기보다, 복잡한 절차 안내나 다국어 응대처럼 실패 비용이 큰 구간에 한정해 투입하는 편이 낫다. 얼굴이 붙으면 사용자의 기대치가 급격히 올라가므로, 모델이 모르는 것을 모른다고 말하는 대본을 먼저 마련해야 한다. 아바타 생성용 참조 이미지와 음성의 권리 확보, 그리고 AI 생성물임을 화면에 명시하는 표기도 기획 단계에서 함께 정리할 항목이다.
교차 참고
- Google Blog: Gemini 3.8 text-to-speech says hello — 100개 이상 언어와 2,000여 개 음색을 제공하는 신규 TTS 모델 2종을 제미나이 API·AI 스튜디오에 공개.
- Google Blog: Google Beam expands with new regions, partners, and customers — 3D 원격 회의 플랫폼 빔을 5개국으로 확대, 실재감 기술의 상용화 흐름을 보여준다.
Wemeet의 관점
Wemeet은 아바타를 "사람 대체"가 아니라 "대기 시간 제거" 기술로 본다. 고객이 불만을 갖는 지점은 대개 담당자가 없다는 사실이 아니라, 답을 받기까지 걸리는 시간이다. 다만 웹사이트에 얼굴을 띄우는 선택은 브랜드 인격을 고정시키는 결정이기도 하다. 톤·표정·목소리를 정하지 않은 채 기술만 먼저 붙이면, 정성껏 만든 브랜드 이미지가 기본 아바타에 끌려간다.
이 글은 아래 원문을 바탕으로 Wemeet이 한국어로 요약·정리한 큐레이션입니다.
원문 보기 — Google Blog ↗