제미나이 3.8 신제품, 아바타·TTS 사용 범위

태블릿 화면 속 3D 아바타와 스튜디오 마이크, 제미나이 3.8 아바타와 사용 범위를 다룬 대표 이미지

Google이 열흘 사이 Gemini 오디오 업데이트를 세 차례 내놨다. 9월 15일 대화하며 생각하는 3.8 Live, 23일 목소리를 설계하는 3.8 TTS, 24일 표정과 입 모양을 붙인 Live Avatar다.

쓸 수 있는 사람은 각각 다르다. Live Avatar는 기업용 Gemini Enterprise에서만 열렸다. 새 TTS는 Gemini Notebook과 Google Vids를 통해 일반 사용자에게도 들어왔다.

이 글의 표기 기준

📌 확정: Google 공식 발표·문서로 확인된 내용

📢 발표: 공개됐지만 아직 제공되지 않는 기능

🔎 분석: 공개 자료를 바탕으로 한 Hoonyspot의 판단

2026년 9월 25일 기준으로 확인한 내용입니다. 응답 지연이나 음성 품질은 이 글에서 직접 측정하지 않았습니다.

제미나이 3.8 신제품, 기능과 사용 범위 한눈에

발표일모델·기능핵심일반 사용자
9월 15일3.8 Live / Extended Thinking말하면서 추론, 대화 중 백그라운드 작업Search Live, Gemini Live
9월 23일3.8 Flash TTS / Flash-Lite TTS문장으로 목소리 설계, 대사별 연기 지시Gemini Notebook, Google Vids
9월 24일3.8 Live with Live Avatar실시간 대화에 표정·입 모양 영상 결합없음 (기업용만)

📌 세 발표는 모두 Google의 Gemini Audio 팀 이름으로 나왔고, 같은 모델 카드를 공유한다. 모델 카드가 구분하는 모델은 Live, Live Extended Thinking, Flash TTS, Flash-Lite TTS 네 가지다. Live Avatar는 별도 모델이 아니라 3.8 Live에 붙는 선택 기능이다.

🔎 역할로 나누면 이해가 쉽다. 3.8 Live가 듣고 생각하는 두뇌라면, TTS는 목소리, Live Avatar는 얼굴에 해당한다.

Gemini 3.8 Live Avatar, 무엇이 새로운가

📌 Live Avatar는 음성에 캐릭터 그림을 덧씌운 기능이 아니다. 3.8 Live의 실시간 대화 능력에 저지연 스트리밍 영상 생성을 묶었다. AI가 사용자의 목소리와 화면을 동시에 받아들이고, 대답하는 순간 표정과 입 모양을 함께 만든다.

Google은 영상 생성 지연을 설명할 때 ‘거의 실시간(near real-time)’이라는 표현도 썼다. 실제 응답 지연이 영상통화 수준인지는 외부 검증이 아직 없다.

항목공식 발표 내용
표현정확한 립싱크, 자연스러운 표정, 매끄러운 말 주고받기
입력카메라·화면 공유와 음성을 동시에 처리
작업 처리대화를 끊지 않고 뒤에서 도구 호출·데이터 조회
언어97개 언어, 대화 중 전환 시 입 모양도 맞춰 변경
아바타기본 아바타 라이브러리 + 참조 이미지로 맞춤 제작(허용 목록 기업만)
워터마크음성과 영상 모두에 보이지 않는 SynthID
제공 범위Gemini Enterprise 정식 제공, 미국·EU 엔드포인트

Google이 보여준 시연 중 하나는 호텔 체크인이다. 아바타가 투숙객과 대화를 이어가는 동안 뒤에서는 예약 조회 같은 작업이 돌아간다.

📌 다만 장시간 대화에는 한계가 있다. Google 모델 카드는 Live Avatar의 연속 상호작용을 몇 시간이 아니라 몇 분 수준으로 설명한다. 가끔 느려지거나 시간 초과가 날 수 있다는 점도 한계로 적었다. 긴 상담이나 수업에 쓰려면 세션 연결과 중단 대응을 따로 설계해야 한다.

일반 Gemini 앱에서는 쓸 수 없습니다

Live Avatar는 기업용 Gemini Enterprise에서 제공됩니다. Gemini 앱이나 개인 계정용 출시 일정은 발표되지 않았습니다. 참조 이미지로 만드는 맞춤 아바타는 기업 허용 목록(allowlist)과 검증 절차를 거친 곳만 쓸 수 있습니다.

제미나이 3.8 업데이트 세 차례의 발표일과 개인·개발자·기업별 제공 범위를 정리한 표

Gemini 3.8 TTS, 목소리를 문장으로 설계한다

📌 하루 앞선 9월 23일에는 음성 생성 모델 두 개가 나왔다. 3.8 Flash TTS는 캐릭터 목소리와 연기 연출에, 3.8 Flash-Lite TTS는 더빙처럼 대량 작업을 싸게 처리하는 데 맞췄다.

가장 큰 변화는 목소리를 고르는 방식에서 만드는 방식으로 바뀐 점이다. 기존에는 30개 기본 목소리 중 하나를 골랐다. 이제는 “멜버른 억양의 에너지 넘치는 DJ”처럼 문장으로 설명하면 새 목소리가 나온다.

기능내용
목소리 설계역할·억양·음색을 자연어로 지정, 100개 이상 언어·방언
목소리 라이브러리바로 쓸 수 있는 목소리 2,000개 이상
목소리 복제30초 샘플로 복제, 목소리 주인의 동의 녹음 필수
연기 지시대사마다 감정·속도·억양 지정, 웃음·한숨 같은 소리 삽입
2인 대화·장시간대본 하나로 두 사람 대화, 몇 시간 분량도 음색 유지
보호 장치생성 음성에 SynthID, 목소리 복제에는 C2PA 출처 정보도 안내
목소리 리믹스📢 곧 제공 (라이브러리 목소리의 음색·속도 미세 조정)

📌 목소리 복제에는 조건이 붙는다. 본인 목소리이거나 사용 권리가 있는 목소리여야 한다. 기준 음성과 같은 사람의 동의 녹음이 있어야 복제가 된다. Google AI Studio의 복제 기능은 미국 일리노이·텍사스, 유럽경제지역, 영국, 스위스, 인도에서는 쓸 수 없다.

성능은 Google 발표 기준으로 Hume AI의 목소리 설계 벤치마크 71.4점, 1위다. 회사가 직접 밝힌 수치라는 점은 감안해야 한다. 이번 발표문에 열거된 사람 선호도 평가 언어에는 한국어가 명시되지 않았다.

TTS의 ‘몇 시간 분량 생성’은 녹음물을 만드는 기능이다. 앞에서 본 Live Avatar의 연속 대화 시간과는 다른 조건이다.

누가 지금 쓸 수 있나

세 업데이트 모두 “출시”로 보도되지만 문이 열린 곳은 다르다. 개인 사용자, 개발자, 기업으로 나누면 이렇다.

기능개인 사용자개발자기업 (Gemini Enterprise)
Live Avatar❌Gemini Enterprise API📌 정식 제공, 맞춤 아바타는 별도 허용
3.8 Live📌 Search Live📌 Gemini API, AI Studio📌 정식 제공
3.8 Live Extended Thinking📌 Gemini Live📌 Gemini API, AI Studio비공개 프리뷰
3.8 Flash TTS📌 Gemini Notebook📌 Gemini API, AI Studio📢 제공 예정
3.8 Flash-Lite TTS📌 Google Vids📌 Gemini API, AI Studio📢 제공 예정

출처: Google 공식 블로그 9월 15일·23일·24일 발표 및 9월 24일 Google Cloud 발표 기준 (2026-09-25 확인). 개인 제공은 계정·국가별로 순차 적용될 수 있습니다.

🔎 개인이 지금 체감할 수 있는 건 목소리 쪽이다. Google Vids에 들어간 Flash-Lite TTS는 보이스오버를, Gemini Notebook의 Flash TTS는 문서를 오디오로 바꾸는 품질을 바꾼다. 얼굴 있는 AI는 당분간 기업 서비스의 상담 창구에서 먼저 만나게 된다.

텍스트 챗봇에서 음성 AI, 3.8 Live, Live Avatar로 이어지는 대화 방식 변화 4단계

텍스트 챗봇에서 얼굴 있는 AI까지, 인터페이스의 변화

🔎 세 업데이트를 한 줄로 세우면 AI와 대화하는 방식이 어떻게 바뀌어 왔는지 보인다. 핵심은 사람이 AI에 맞추던 부분이 하나씩 줄어든다는 점이다.

텍스트 챗봇에서는 질문을 글로 정리해 입력해야 했다. 음성 AI는 말로 묻게 해줬지만, AI가 말을 끝낼 때까지 기다려야 했다. 3.8 Live는 여기서 한 단계 더 나가 말하면서 생각하고, 작업은 뒤에서 처리한다. 사용자가 대화를 멈추고 기다릴 일이 줄었다.

Live Avatar가 노리는 건 그다음 빈틈이다. 사람은 대화할 때 상대 얼굴에서 “듣고 있다”, “이해했다”는 신호를 읽는다. 음성 AI는 이 신호가 없어 사용자가 말을 반복하거나 머뭇거리는 순간이 생긴다. 표정과 입 모양은 이 신호를 화면으로 되돌려준다.

고객상담·AI 튜터·쇼핑 안내는 어떻게 달라지나

🔎 Google은 고객 서비스와 대화형 안내를 쓰임새로 제시했다. 메뉴형·규칙 기반 상담봇과 비교하면 달라지는 지점과 남는 과제가 함께 보인다.

분야메뉴형·규칙 기반 상담봇얼굴 있는 AI남는 과제
고객상담메뉴 선택, 정해진 답변대화하며 조회·처리, 97개 언어 전환자동 처리 권한과 사람에게 넘길 기준 설정
AI 튜터글로 묻고 글로 설명학생 화면을 보며 표정 섞인 설명몇 분 단위 연속 대화 한계, 수업 길이 설계
쇼핑 안내상품 필터, FAQ매장 직원처럼 묻고 추천추천과 광고의 구분 표시
가상 직원키오스크 화면호텔 체크인·안내 데스크 역할AI임을 명확히 알리는 안내 설계

자연스러운 얼굴과 목소리가 답변의 정확성까지 보장하지는 않는다. 모델 카드도 그럴듯한 오답(환각) 가능성을 한계로 적고 있다. 도입하는 쪽은 기술보다 AI임을 알리는 방식과 사람에게 넘길 기준을 먼저 설계해야 한다.

호텔 로비 키오스크 화면의 AI 아바타와 그 앞에 선 투숙객의 뒷모습

1인 크리에이터가 지금 챙길 것

🔎 유튜브 내레이션이나 팟캐스트를 만드는 사람에게 당장 의미 있는 건 Live Avatar보다 TTS다. 대사마다 감정과 속도를 지시하고, 두 사람 대화를 대본 하나로 만들 수 있다.

목소리 복제 기능도 발표됐다. 다만 한국 계정의 기능 제공 여부와 한국어 품질은 별도 확인이 필요하다. 한국어 채널이라면 짧은 대본으로 먼저 시험해 보는 게 순서다.

☐ 개발자라면 Google AI Studio의 음성 생성 화면에서 목소리 설계를 시험할 수 있습니다.

☐ 개발 없이 쓰려면 Google Vids 보이스오버나 Gemini Notebook 오디오 기능을 확인해 보세요.

☐ 목소리 복제는 본인 또는 권리를 가진 목소리만, 동의 녹음과 함께 가능합니다.

☐ 생성 음성에는 SynthID가 들어갑니다. 플랫폼 업로드 시 AI 콘텐츠 표시 규정을 확인하세요.

제미나이 3.8 Live Avatar와 TTS 핵심을 네 줄로 정리한 요약 카드

핵심 요약

📌 Live Avatar는 3.8 Live에 표정·입 모양 영상을 붙인 선택 기능이다. Gemini Enterprise 전용이다.

📌 모델 카드 기준 연속 대화는 몇 분 수준이다. 맞춤 아바타는 허용 목록 기업만 가능하다.

📌 3.8 TTS는 문장으로 목소리를 만들고, Gemini Notebook·Google Vids로 일반 사용자에게도 들어왔다.

🔎 개인이 먼저 체감하는 건 목소리다. 얼굴 있는 AI는 기업 상담 창구에서 먼저 만나게 된다.

자주 묻는 질문

Q. Gemini 앱에서 아바타와 영상통화할 수 있나요?

아직은 할 수 없습니다. Live Avatar는 기업용 Gemini Enterprise에서만 제공되며, 개인용 출시 일정은 발표되지 않았습니다.

Q. 내 목소리를 복제해 영상 내레이션에 쓸 수 있나요?

Google AI Studio에서 30초 샘플과 목소리 주인의 동의 녹음으로 복제하는 기능이 발표됐습니다. 일부 지역(미국 일리노이·텍사스, 유럽경제지역, 영국, 스위스, 인도)은 제외됩니다. 한국은 제외 목록에 없지만, 계정별 제공 여부와 한국어 품질은 직접 확인해 보시는 것이 좋습니다.

Q. AI가 만든 목소리나 얼굴인지 구분할 수 있나요?

귀나 눈으로는 어렵습니다. Google은 생성 음성과 아바타 영상에 보이지 않는 SynthID 워터마크를 넣고, 목소리 복제에는 C2PA 출처 정보도 안내하고 있습니다.

참고자료

글쓴이 Hoony

콘텐츠 크리에이터로 활동 중입니다. Hoonyspot은 AI와 IT·영화와 드라마를 공식 자료와 신뢰할 수 있는 출처를 바탕으로 확인하고, 필요한 맥락과 분석을 더해 정리하는 라이프 매거진입니다. 이 글에 적힌 수치·정책 조건은 발행 시점 기준이며, 변동될 수 있습니다.

함께 보면 좋은 글

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다