Gemini 3.5 Transcribe 사용법 음성 텍스트 변환 실시간 받아쓰기

Gemini 3.5 Transcribe 사용법|음성을 텍스트로 변환하는 방법·실시간 받아쓰기 총정리

Google이 2026년 8월 공개한 Gemini 3.5 Transcribe는 사람의 음성을 텍스트로 바꾸는 Speech-to-Text(STT) 작업에 특화된 모델입니다.

단순히 녹음 내용을 받아쓰는 수준을 넘어 언어 자동 감지, 여러 화자 구분, 단어 수준 타임스탬프, 전문용어를 위한 맞춤 어휘, 추임새와 반복 표현을 정리하는 Smart transcription까지 지원합니다.

특히 Gemini 3.5 Transcribe 사용법을 알아두면 회의 녹음, 인터뷰, 강의, 고객 상담, 영상 자막처럼 음성 자료를 텍스트로 바꾸는 작업을 목적에 맞게 구성할 수 있습니다.

사용 방식은 크게 두 가지입니다. 녹음된 오디오 파일을 처리할 때는 gemini-3.5-transcribe, 마이크에서 들어오는 음성을 실시간으로 문자화할 때는 gemini-3.5-transcribe-live를 사용합니다. 이름은 비슷하지만 지원 기능과 처리 방식이 다르기 때문에 먼저 두 모델의 차이를 이해하는 것이 중요합니다.

Gemini 3.5 Transcribe 사용법 음성 텍스트 변환 주요 기능

Table of Contents

Gemini 3.5 Transcribe란?

Gemini 3.5 Transcribe는 Gemini의 오디오 이해 기술을 기반으로 설계된 음성 텍스트 변환 전용 모델입니다.

Google은 2026년 8월 26일 Gemini 3.5 Transcribe를 공개했고, 한국 Google 공식 블로그에서도 8월 27일 별도로 소개했습니다. 현재 개발자는 Gemini API와 Google AI Studio 등을 통해 모델을 사용할 수 있습니다.

일반적인 Gemini 모델이 글 작성, 분석, 코딩, 파일 이해 등 다양한 작업을 담당한다면 Gemini 3.5 Transcribe는 사람이 말한 내용을 정확하고 활용하기 쉬운 텍스트 데이터로 바꾸는 작업에 초점을 맞추고 있습니다.

Gemini 3.5 Transcribe 사용법에서 알아둘 주요 기능은 다음과 같습니다.

  • 85개 이상의 언어 자동 감지
  • 여러 언어가 섞이는 코드 스위칭 처리
  • 한국어 음성 처리
  • 화자 분리
  • 단어 수준 타임스탬프
  • 최대 1,000개의 맞춤 어휘
  • Smart transcription
  • Verbatim 전사
  • 실시간 스트리밍 음성 인식
  • 숫자·날짜·통화 등의 자동 서식 정리

Google 공식 문서에서는 자동 언어 식별, 화자 분리, 단어 수준 타임스탬프, 맞춤 어휘 힌트, Smart transcription을 핵심 기능으로 안내하고 있습니다.

성능도 이전 세대보다 개선됐습니다. Google 공식 발표에 따르면 이전 음성 변환 모델 Chirp 3와 비교해 최종 전사 완료 시간이 70% 개선됐습니다. FLEURS 다국어 벤치마크에서는 스트리밍 5.50% WER, 비스트리밍 5.04% WER을 기록했습니다.

Gemini 3.5 Transcribe와 Live 차이

Gemini 3.5 Transcribe 사용법을 처음 접할 때 가장 먼저 구분해야 하는 것이 일반 Transcribe와 Transcribe Live입니다.

구분Gemini 3.5 TranscribeGemini 3.5 Transcribe Live
모델 IDgemini-3.5-transcribegemini-3.5-transcribe-live
주요 용도녹음된 오디오 파일 변환실시간 스트리밍 음성 변환
처리 방식파일 기반 처리실시간 WebSocket 스트리밍
언어 자동 감지85개 이상85개 이상
코드 스위칭지원지원
화자 분리지원지원하지 않음
단어 수준 타임스탬프지원지원하지 않음
맞춤 어휘지원지원
Smart transcription지원지원
대표 활용회의·인터뷰·강의 녹취실시간 자막·음성 입력

녹음된 회의나 인터뷰 파일을 나중에 텍스트로 변환하려면 일반 Transcribe가 적합합니다. 반대로 사람이 말하는 동안 화면에 자막을 표시하거나 실시간 음성 입력 서비스를 만들려면 Live 모델을 선택하는 방식입니다.

따라서 Gemini 3.5 Transcribe 사용법을 익힐 때는 먼저 내가 처리하려는 음성이 이미 저장된 파일인지, 지금 들어오는 실시간 음성인지부터 구분하면 됩니다.

Gemini 3.5 Transcribe 사용법

처음 사용하는 경우 복잡한 애플리케이션을 바로 만드는 것보다 Google AI Studio와 Gemini API 환경을 준비하고 짧은 오디오 파일을 테스트하는 순서가 이해하기 쉽습니다.

1. Google AI Studio에 접속하기

먼저 Google AI Studio에 Google 계정으로 로그인합니다.

Gemini 3.5 Transcribe는 일반 Gemini 채팅 화면에서 단순히 모델을 선택해 대화하는 것보다는 개발자가 Gemini API를 통해 음성 파일을 전달하고 결과를 받아 사용하는 모델로 이해하는 것이 정확합니다.

Google은 개발자가 Gemini API와 Google AI Studio에서 해당 모델을 사용할 수 있도록 제공하고 있습니다.

처음 Google AI Studio를 사용하는 경우 ToolLab365의 기존 Google AI Studio 사용법 완벽 가이드|Gemini API 키 발급부터 활용까지 7단계를 먼저 확인하면 API 환경을 준비하는 데 도움이 됩니다.

2. Gemini API 키 준비하기

Gemini 3.5 Transcribe 사용법에서 다음 단계는 Gemini API 키 준비입니다.

이미 Google AI Studio에서 Gemini API를 사용하고 있다면 기존 키를 확인하면 되고, 처음 사용하는 경우 AI Studio에서 API 키를 생성합니다.

API 키가 생성되지 않거나 권한·결제·할당량과 관련된 오류가 발생한다면 ToolLab365의 기존 Google AI Studio API 키 오류 해결 방법 글과 함께 확인하면 됩니다.

API 키는 외부에 노출하지 않는 것이 중요하며 실제 웹서비스에 적용할 때는 브라우저 코드에 키를 직접 넣는 방식보다 서버 환경에서 관리하는 것이 안전합니다.

3. 오디오 파일 준비하기

파일 기반 Gemini 3.5 Transcribe 사용법은 기본적으로 다음 흐름으로 진행됩니다.

오디오 파일 준비 → 파일 업로드 → 파일 URI 확보 → Transcribe 모델 호출 → 변환 결과 확인

Google 공식 문서에서도 오디오 파일을 업로드한 뒤 해당 파일을 gemini-3.5-transcribe 모델로 전달하는 방식을 기본 예제로 안내합니다.

4. Python으로 음성을 텍스트로 변환하기

Python을 이용하면 다음과 같은 구조로 테스트할 수 있습니다.

from google import genai

client = genai.Client()

audio_file = client.files.upload(
    file="path/to/sample.mp3"
)

interaction = client.interactions.create(
    model="gemini-3.5-transcribe",
    input=[
        {
            "type": "audio",
            "uri": audio_file.uri,
            "mime_type": audio_file.mime_type,
        }
    ],
)

print(interaction.output_text)

위 코드는 파일을 업로드하고 업로드된 오디오 정보를 gemini-3.5-transcribe에 전달한 뒤 변환된 텍스트를 출력하는 기본 구조입니다. Google 공식 문서에서도 이 방식의 Python 예제를 제공합니다.

처음 Gemini 3.5 Transcribe 사용법을 테스트한다면 긴 회의 파일부터 넣기보다 1~3분 정도의 짧은 녹음으로 결과를 먼저 확인하는 편이 좋습니다.

Gemini 3.5 Transcribe 사용법 Google AI Studio 음성 파일 변환 과정

한국어 음성도 자동으로 인식할 수 있을까?

가능합니다.

Gemini 3.5 Transcribe는 85개 이상의 언어를 자동으로 감지하고 여러 언어가 섞여 등장하는 코드 스위칭도 처리할 수 있습니다.

따라서 한국어로 회의를 하면서 Gemini, WordPress, API처럼 영어 제품명이나 기술 용어를 함께 말하는 상황에서도 활용할 수 있습니다.

한국어 중심으로 Gemini 3.5 Transcribe 사용법을 찾는 사용자라면 별도의 한국어 전용 Transcribe 모델을 선택할 필요는 없습니다.

언어를 지정하지 않으면 모델이 자동으로 감지하며, 입력 언어를 알고 있다면 BCP-47 언어 코드를 전달할 수도 있습니다.

generation_config = {
    "transcription_config": {
        "language_codes": ["ko-KR"],
    }
}

한국어 회의록, 강의 녹음, 음성 메모, 인터뷰, 영상 자막 등을 제작할 때 활용할 수 있습니다.

여러 사람이 말한 회의도 구분할 수 있을까?

파일 기반 Gemini 3.5 Transcribe에서는 Speaker Diarization, 즉 화자 분리 기능을 사용할 수 있습니다.

화자 분리는 녹음에서 서로 다른 목소리를 구별하고 각 발언에 spk_1, spk_2 같은 식별자를 붙이는 방식입니다.

예를 들어 두 사람이 대화했다면 결과를 다음과 같이 구분할 수 있습니다.

spk_1: 오늘 프로젝트 진행 상황부터 확인하겠습니다.
spk_2: 디자인 작업은 현재 약 80% 완료됐습니다.

Google API 문서에서는 최대 8명의 화자를 지원하도록 설정할 수 있다고 안내하며, 3명 이상 화자의 정확한 귀속은 실험적인 기능으로 설명하고 있습니다. Google 공식 소개 글에서도 3명을 초과하는 화자 지원은 실험 단계라고 밝히고 있습니다.

회의나 인터뷰 중심으로 Gemini 3.5 Transcribe 사용법을 활용한다면 단순히 음성을 문자로 옮기는 것보다 누가 어떤 내용을 말했는지 구분할 수 있다는 점이 유용합니다.

다만 여러 명이 동시에 말하거나 목소리가 겹치는 녹음은 자동 화자 구분 결과를 그대로 사용하기보다 원본과 비교해 확인하는 것이 좋습니다.

단어 수준 타임스탬프는 언제 사용할까?

영상 자막이나 인터뷰 편집에서는 텍스트만 있어서는 부족할 수 있습니다.

예를 들어 “이 문장이 영상 몇 초에 나왔는지” 찾아야 한다면 단어별 시간 정보가 필요합니다.

Gemini 3.5 Transcribe는 단어 수준 타임스탬프를 지원해 각 단어의 시작과 종료 위치를 반환할 수 있습니다.

Gemini 3.5 Transcribe 사용법에서 타임스탬프는 다음과 같은 작업에 특히 유용합니다.

  • 유튜브 영상 자막 제작
  • 인터뷰 특정 발언 위치 찾기
  • 회의 녹음에서 필요한 문장 탐색
  • 오디오와 녹취록 비교
  • 영상 편집 지점 확인
  • 음성 데이터 분석

다만 모든 녹취 작업에서 타임스탬프가 필요한 것은 아닙니다. 단순히 회의 내용을 글로 정리하려는 목적이라면 텍스트 자체의 정확성과 가독성을 우선하는 것이 더 효율적일 수 있습니다.

전문용어와 이름을 더 정확하게 인식하는 방법

사람 이름, 브랜드명, 회사명, 제품명이나 IT·의학·법률 분야의 전문용어는 일반 음성 인식에서 오류가 발생하기 쉬운 부분입니다.

Gemini 3.5 Transcribe는 이런 문제를 줄이기 위해 Custom Vocabulary Biasing을 지원합니다.

맞춤 어휘를 사용하면 모델이 특정 단어나 고유명사를 인식할 때 참고할 후보를 미리 제공할 수 있습니다.

Google 공식 API 문서 기준 최대 1,000개의 용어·약어·고유명사를 전달할 수 있습니다.

예를 들어 ToolLab365 관련 녹음이라면 다음처럼 넣을 수 있습니다.

Gemini
WordPress
Rank Math
Google AI Studio
ToolLab365

전문 분야에서 Gemini 3.5 Transcribe 사용법을 적용할 계획이라면 자주 등장하는 제품명과 인물명, 약어를 미리 정리해 두는 것이 좋습니다.

Gemini 3.5 Transcribe Verbatim Smart transcription 맞춤 어휘 기능

Smart transcription은 무엇이 다른가?

Gemini 3.5 Transcribe에는 크게 Verbatim과 Smart transcription이라는 두 가지 전사 방식이 있습니다.

이 차이를 알아두는 것이 Gemini 3.5 Transcribe 사용법에서 상당히 중요합니다.

Verbatim 모드

Verbatim은 사람이 실제로 말한 내용을 가능한 그대로 보존하는 방식입니다.

예를 들어 사람이 다음처럼 말했다고 가정해 보겠습니다.

“음… 회의는 화요일… 아니, 수요일 오후 두 시로 하죠.”

Verbatim에서는 머뭇거림이나 반복, 중간에 말을 수정한 과정까지 비교적 그대로 남길 수 있습니다.

따라서 인터뷰 원문, 연구 기록, 상세 녹취처럼 실제로 어떤 표현을 사용했는지 보존하는 것이 중요할 때 적합합니다.

또 화자 분리와 단어 수준 타임스탬프도 Verbatim 모드에서 설정합니다.

Smart transcription

Smart transcription은 사람이 말한 내용을 그대로 복제하기보다 읽기 좋은 텍스트로 정돈하는 데 초점을 맞춥니다.

Google 공식 문서에서는 다음과 같은 처리를 지원한다고 설명합니다.

  • “음”, “어” 같은 추임새 제거
  • 말더듬이나 반복 표현 정리
  • 잘못 시작한 문장 정리
  • 말하는 도중 수정한 내용 반영
  • 자연스러운 구두점 처리
  • 문단 및 목록 구조화
  • 숫자·날짜·통화 형식 정리

예를 들어 “화요일에 만나죠, 아니 수요일 오후 두 시요”라고 말했다면 최종 의도에 맞게 읽기 좋은 문장으로 정리할 수 있습니다.

회의록이나 강의 노트를 만들 때는 실제 말투를 전부 남기는 것보다 이런 정돈된 결과가 편할 수 있습니다.

Smart transcription에서 반드시 알아둘 제한

여기서 중요한 제약이 있습니다.

Smart transcription은 화자 분리와 단어 수준 타임스탬프를 함께 사용할 수 없습니다.

Google 공식 문서에서도 smart 모드는 timestamp_granularitiesdiarization_mode와 호환되지 않는다고 명시하고 있습니다. 화자 구분이나 단어별 시간 정보가 필요하다면 verbatim을 사용해야 합니다.

따라서 Gemini 3.5 Transcribe 사용법에서는 기능을 전부 켜는 것이 아니라 작업 목적을 먼저 정해야 합니다.

사람별 발언 구분 → Verbatim + 화자 분리

영상 자막 시간 정보 → Verbatim + 타임스탬프

읽기 좋은 회의록 → Smart transcription

이렇게 나누면 이해하기 쉽습니다.

Gemini 3.5 Transcribe Live로 실시간 받아쓰기 하기

저장된 파일이 아니라 지금 말하는 음성을 바로 텍스트로 바꾸려면 gemini-3.5-transcribe-live를 사용합니다.

Live 모델은 WebSocket을 이용한 양방향 스트리밍 음성 전사를 위해 설계됐으며 Google은 대화형 음성 애플리케이션에서 1초 미만 수준의 지연시간을 제공한다고 설명합니다.

실시간 환경의 Gemini 3.5 Transcribe 사용법은 다음과 같은 서비스와 잘 맞습니다.

  • 실시간 회의 자막
  • 라이브 방송 자막
  • 음성 입력 서비스
  • 고객센터 상담 기록
  • 접근성용 실시간 자막
  • 인터뷰 현장 기록
  • 음성 기반 애플리케이션

일반 Transcribe가 녹음이 끝난 파일을 자세히 처리하는 데 적합하다면 Live는 사용자가 말하는 동안 결과가 계속 필요한 서비스에 더 적합합니다.

특히 Live와 파일 Transcribe는 같은 모델이라고 생각하고 기능을 그대로 적용하면 안 됩니다. 파일 모델에서 사용할 수 있는 화자 분리와 단어 수준 타임스탬프가 Live에서는 동일하게 제공되지 않습니다.

Gemini 3.5 Transcribe 무료 사용이 가능한가?

가능합니다.

현재 Google의 Gemini API 공식 가격표에는 Gemini 3.5 Transcribe와 Gemini 3.5 Transcribe Live 모두 Free Tier가 제공되는 것으로 표시되어 있습니다.

따라서 Gemini 3.5 Transcribe 사용법을 처음 익힐 때는 무료 등급에서 짧은 음성을 테스트하고 결과를 확인해 볼 수 있습니다.

다만 Free Tier는 무제한이라는 의미가 아닙니다. 계정과 프로젝트에 적용되는 사용 한도 및 정책을 확인해야 합니다.

또 Google 공식 가격표에서는 Free Tier에서 처리한 데이터가 제품 개선에 사용될 수 있다고 표시하고 있으며 Paid Tier는 해당 항목이 No로 표시됩니다.

회사 내부 회의, 고객 통화, 개인정보 등이 포함된 오디오를 실제 업무에서 처리하려면 가격뿐 아니라 데이터 처리 정책도 함께 검토하는 것이 좋습니다.

Gemini 3.5 Transcribe 가격

Google 공식 Gemini API 가격표 기준 가격은 다음과 같습니다.

모델명무료 등급오디오 입력 비용텍스트 출력 비용예상 분당 비용
Gemini 3.5 TranscribeFree Tier 제공$2.00 / 100만 토큰$12.00 / 100만 토큰약 $0.005 / 분
Gemini 3.5 Transcribe LiveFree Tier 제공$3.50 / 100만 토큰$21.00 / 100만 토큰약 $0.009 / 분

일반 Transcribe는 공식 예상치 기준 오디오 입력이 약 $0.003/분, 텍스트 출력이 약 $0.002/분입니다. 이를 합치면 약 $0.005/분 수준입니다.

Live는 오디오 입력 약 $0.005/분, 텍스트 출력 약 $0.004/분으로 합산하면 약 $0.009/분입니다.

예를 들어 일반 Transcribe로 60분 분량을 처리한다고 단순 계산하면 약 $0.30 수준이지만 실제 비용은 처리되는 입력·출력 토큰량에 따라 달라질 수 있습니다.

가격은 향후 변경될 수 있으므로 실제 서비스를 운영하기 전에는 Google 공식 가격표를 다시 확인하는 것이 안전합니다.

Gemini 3.5 Transcribe를 어디에 활용할 수 있을까?

Gemini 3.5 Transcribe 사용법을 실제 업무에 적용할 때는 음성 파일을 단순히 텍스트로 바꾸는 것보다 최종 결과를 어디에 사용할지 먼저 정하는 것이 좋습니다.

회의록 작성

여러 사람이 참여한 회의에서는 화자 분리를 이용해 사람별 발언을 구분할 수 있습니다.

다만 누가 말했는지보다 읽기 좋은 회의 요약용 초안이 중요하다면 Smart transcription을 사용하는 방식이 더 편할 수 있습니다.

두 기능은 목적이 다르기 때문에 결과물에 따라 선택해야 합니다.

인터뷰 녹취

인터뷰에서는 질문자와 답변자의 발언을 나누는 것이 중요합니다.

화자 분리를 이용하면 사람별 발언을 구분할 수 있고, 영상이나 오디오의 특정 구간을 찾아야 한다면 타임스탬프를 활용할 수 있습니다.

영상 자막

영상 제작에서는 특정 단어와 발언 시점을 연결해야 하는 경우가 많습니다.

이때 단어 수준 타임스탬프를 활용하면 자막 편집과 특정 발언 위치 확인에 도움을 받을 수 있습니다.

강의 녹음

강의 내용은 말한 그대로의 기록보다 읽기 쉬운 노트 형태가 필요한 경우가 많습니다.

추임새나 반복 표현이 많은 강의라면 Smart transcription을 이용해 정돈된 텍스트를 얻는 방식이 유용합니다.

고객 상담

실시간 상담 내용을 화면에 바로 표시하거나 서비스 내부에 저장하려면 Live 모델을 활용할 수 있습니다.

반대로 상담이 끝난 후 녹음된 통화 파일을 일괄 분석하려면 일반 Transcribe 방식이 더 적합합니다.

Gemini 3.5 Transcribe와 Live 차이 실시간 받아쓰기 기능 비교

사용 전에 알아둘 핵심 제약

Gemini 3.5 Transcribe 사용법을 실제 서비스에 적용하려면 지원 기능뿐 아니라 기능끼리 충돌하는 조건을 확인해야 합니다.

가장 중요한 부분은 Smart transcription과 화자 분리·타임스탬프의 관계입니다.

Smart transcription은 읽기 좋은 문서로 정리하는 데 초점이 맞춰져 있고, 화자 분리와 단어별 타임스탬프는 원래 발화 구조를 세밀하게 추적하는 기능입니다.

따라서 두 목적을 동시에 설정할 수 없습니다. Google 공식 문서에서도 Smart transcription과 timestamp_granularities, diarization_mode는 호환되지 않는다고 명확하게 안내합니다.

결과적으로 기능 선택은 다음처럼 생각하면 쉽습니다.

원하는 결과선택하면 좋은 기능
말한 내용을 최대한 그대로 기록Verbatim
누가 말했는지 구분Verbatim + Speaker Diarization
단어별 시간 확인Verbatim + Word Timestamp
추임새·반복을 정리한 문서Smart transcription
전문용어 인식 개선Custom Vocabulary
실시간 자막Gemini 3.5 Transcribe Live

기능이 많다고 전부 활성화하는 것보다 목적에 맞는 설정을 선택해야 결과도 더 이해하기 쉬워집니다.

자주 묻는 질문 FAQ

Gemini 3.5 Transcribe 사용법은 어렵나요?

기본적인 파일 변환은 오디오 파일을 업로드한 뒤 gemini-3.5-transcribe 모델에 전달하는 구조라 어렵지 않습니다. Google 공식 문서에서도 Python, JavaScript, REST 예제를 제공하고 있습니다.

Gemini 3.5 Transcribe는 한국어를 지원하나요?

네. 85개 이상의 언어를 자동으로 감지하며 한국어 음성도 처리할 수 있습니다. 언어가 섞이는 코드 스위칭 역시 지원합니다.

Gemini 3.5 Transcribe는 무료인가요?

현재 Gemini API 공식 가격표에는 Free Tier가 제공됩니다. 하지만 무료 사용량에는 제한이 있으므로 실제 서비스에 적용하기 전에는 현재 할당량을 확인해야 합니다.

여러 사람의 목소리를 구분할 수 있나요?

파일 기반 Transcribe에서는 화자 분리를 사용할 수 있습니다. API 문서상 최대 8명의 화자를 지원하며 3명 이상에 대한 화자 귀속은 실험적인 기능입니다.

전문용어나 브랜드명도 지정할 수 있나요?

가능합니다. Custom Vocabulary를 이용해 최대 1,000개의 용어, 약어, 고유명사를 전달할 수 있습니다.

실시간 받아쓰기도 가능한가요?

가능합니다. 실시간 음성 변환에는 gemini-3.5-transcribe-live를 사용합니다. WebSocket 기반 스트리밍을 이용해 음성이 들어오는 동안 텍스트를 처리합니다.

Smart transcription은 언제 사용하면 좋나요?

회의록이나 강의처럼 “음”, “어”, 반복 표현 등을 그대로 남길 필요가 없고 읽기 좋은 문서가 필요한 경우 적합합니다.

Smart transcription과 화자 분리를 같이 사용할 수 있나요?

아니요. Smart transcription은 화자 분리 및 단어 수준 타임스탬프와 함께 사용할 수 없습니다. 화자 정보나 시간 정보가 필요하다면 Verbatim 모드에서 해당 기능을 사용해야 합니다.

일반 Gemini의 음성 기능과 똑같은 건가요?

완전히 같은 사용 방식은 아닙니다. Google은 Gemini 앱과 Android 등 일부 제품에도 3.5 Transcribe 기술을 활용하고 있지만 개발자가 gemini-3.5-transcribe 모델을 직접 호출하는 방식은 Gemini API 기반입니다.

Gemini 3.5 Transcribe, 어떤 작업에 선택하면 좋을까?

Gemini 3.5 Transcribe는 단순한 받아쓰기 도구보다 음성을 업무에 활용할 수 있는 구조화된 텍스트로 바꾸는 모델에 가깝습니다.

녹음된 회의, 인터뷰, 강의, 상담 파일을 처리하려면 gemini-3.5-transcribe, 지금 들어오는 음성을 실시간으로 문자화해야 한다면 gemini-3.5-transcribe-live를 선택하면 됩니다.

특히 자동 언어 감지, 화자 분리, 단어 수준 타임스탬프, 맞춤 어휘, Smart transcription을 목적에 따라 선택할 수 있다는 점이 강점입니다.

Gemini 3.5 Transcribe 사용법을 처음 익힌다면 Free Tier에서 짧은 한국어 음성을 먼저 테스트하고, 그다음 원문 그대로의 기록이 필요한지, 사람별 구분이 필요한지, 시간 정보가 필요한지, 읽기 좋은 문서가 필요한지를 결정하는 순서가 좋습니다.

모든 기능을 한 번에 사용하려 하기보다 작업 목적에 맞춰 Verbatim, Smart transcription, 화자 분리, 타임스탬프를 선택하면 Gemini 3.5 Transcribe의 장점을 훨씬 제대로 활용할 수 있습니다.

함께 보면 좋은 글

Google AI Studio 사용법 완벽 가이드|Gemini API 키 발급부터 활용까지 7단계

Gemini API를 처음 사용하는 경우 Google AI Studio 접속부터 API 키 발급 과정까지 함께 확인할 수 있습니다.

Google AI Studio API 키 오류 해결 방법|생성 안 됨·권한·결제·할당량 문제 총정리 (2026 최신)

API 키 생성, 권한, 결제 또는 할당량 문제로 Gemini API를 사용할 수 없을 때 함께 확인하면 좋습니다.

Gemini 3.7 Flash 사용법|무료 사용·가격·3.6 차이·코딩·에이전트 성능 총정리 (2026 최신)

음성 전사 전용 모델이 아니라 최신 Gemini의 코딩·에이전트 기능까지 비교하고 싶다면 함께 확인할 수 있습니다.

참고자료

Google 공식 블로그 — Introducing Gemini 3.5 Transcribe

Google Korea 공식 블로그 — 제미나이 3.5 트랜스크라이브로 더 똑똑해진 음성-텍스트 변환

Google AI for Developers — Gemini 3.5 Transcribe 모델

Google AI for Developers — 오디오 스크립트 작성

Google AI for Developers — Gemini API 가격

Similar Posts