音声の文字起こしをしAIモデルが、Googleの「Gemini 3.5 Transcribe」です。
この記事では、従来の音声認識AIとの違いや特徴、料金、実際の使い方までわかりやすく解説します。
Gemini 3.5 Transcribeとは?
Gemini 3.5 Transcribeは、Googleが開発した最新の音声認識(Speech-to-Text)AIモデルです。
従来の音声認識は「聞こえた音をそのまま文字にする」だけでした。一方Gemini 3.5 Transcribeは、話し手の意図を汲み取ってテキストをきれいに整えてくれる、いわばスマートな文字起こしに特化しています。
前世代モデル(Chirp 3)と比べると、処理速度は約70%高速化し、認識精度も大幅に向上しました。

4つのポイント
① 言い淀みや言い直しを自動補正(スマートモード)
「えーっと」「あー」といったフィラー(言い淀み)を自動でカットしてくれます。
さらに便利なのが言い直しへの対応です。たとえば「来週の火曜、あ、やっぱり水曜で」と話した場合、AIが最終的な意図を理解して「水曜で」と整った文章に出力してくれます。
※聞こえた通りに忠実に記録したい場合は、「逐語(Verbatim)モード」を選ぶこともできます。
② 85以上の言語・専門用語に対応
85以上の言語に対応しており、日本語と英語が混ざった会話でもスムーズに認識します。
また、人名・社名・業界用語・注文IDなど間違いやすい固有名詞は、事前に登録(カスタム語彙)しておくことで誤変換を大きく減らせます。
③ 話者識別とタイムスタンプ機能
録音済みの音声ファイルであれば、次のことが可能です。
- 最大8人(標準は3人まで高精度)の「誰が何を話したか」を識別(ダイアライゼーション)
- 単語ごとにタイムスタンプ(発言時刻)を付与
これにより、会議の議事録作成や動画字幕の作成が格段に楽になります。
④ 長時間の音声も丸ごと処理
1回のリクエストで処理できる音声の長さは次の通りです。
| 条件 | 処理可能な長さ |
|---|---|
| 話者識別・タイムスタンプあり | 最大1時間 |
| 話者識別・タイムスタンプなし | 約8〜9時間 |
長時間のセミナーや2時間のミーティングも、ファイルを分割せず一度に処理できます。
2つの処理モード
用途に合わせて、次の2モードが用意されています。
① 録音ファイル処理(Gemini 3.5 Transcribe) 録音済みのMP3やWAVなどの音声ファイルを渡して書き起こすモード。話者識別やタイムスタンプが必要な会議録音に向いています。
② リアルタイム処理(Gemini 3.5 Transcribe Live) マイクからの音声を1秒未満の超低遅延で文字起こしするモード。ライブ配信の字幕表示やAI音声アシスタントとの会話に適しています。
料金と無料枠
Gemini 3.5 Transcribeは、コストパフォーマンスの高さも魅力です。
API利用料金(従量課金) 録音ファイルの文字起こしは、音声1分あたり約0.003ドル(1時間で約27円程度)と非常に安価です。
無料枠(Free Tier) 「Google AI Studio」の無料枠を使えば、1日の利用制限の範囲内で完全無料で試せます。個人でのテスト利用やMVP(試作品)開発なら、無料枠だけで十分でしょう。
Gemini 3.5 Transcribeは、音声を文字にするだけでなく「そのまま使える美しいテキスト」へ自動で仕上げてくれる画期的なAIモデルです。
- 議事録の修正作業に追われている方
- 音声対応アプリを開発したいエンジニアの方
どちらにとっても、強力な味方になるはずです。Google AI Studioを使えば今すぐ無料で試せるので、手元の録音ファイルで精度を確認してみてはいかがでしょうか。



