AI文字起こし:「Gemini 3.5 Transcribe」特徴・料金・使い方

ブログ

音声の文字起こしをしAIモデルが、Googleの「Gemini 3.5 Transcribe」です。
この記事では、従来の音声認識AIとの違いや特徴、料金、実際の使い方までわかりやすく解説します。

Gemini 3.5 Transcribeとは?

Gemini 3.5 Transcribeは、Googleが開発した最新の音声認識(Speech-to-Text)AIモデルです。

従来の音声認識は「聞こえた音をそのまま文字にする」だけでした。一方Gemini 3.5 Transcribeは、話し手の意図を汲み取ってテキストをきれいに整えてくれる、いわばスマートな文字起こしに特化しています。

前世代モデル(Chirp 3)と比べると、処理速度は約70%高速化し、認識精度も大幅に向上しました。

4つのポイント
① 言い淀みや言い直しを自動補正(スマートモード)

「えーっと」「あー」といったフィラー(言い淀み)を自動でカットしてくれます。

さらに便利なのが言い直しへの対応です。たとえば「来週の火曜、あ、やっぱり水曜で」と話した場合、AIが最終的な意図を理解して「水曜で」と整った文章に出力してくれます。

※聞こえた通りに忠実に記録したい場合は、「逐語(Verbatim)モード」を選ぶこともできます。

② 85以上の言語・専門用語に対応

85以上の言語に対応しており、日本語と英語が混ざった会話でもスムーズに認識します。

また、人名・社名・業界用語・注文IDなど間違いやすい固有名詞は、事前に登録(カスタム語彙)しておくことで誤変換を大きく減らせます。

③ 話者識別とタイムスタンプ機能

録音済みの音声ファイルであれば、次のことが可能です。

  • 最大8人(標準は3人まで高精度)の「誰が何を話したか」を識別(ダイアライゼーション)
  • 単語ごとにタイムスタンプ(発言時刻)を付与

これにより、会議の議事録作成や動画字幕の作成が格段に楽になります。

④ 長時間の音声も丸ごと処理

1回のリクエストで処理できる音声の長さは次の通りです。

条件処理可能な長さ
話者識別・タイムスタンプあり最大1時間
話者識別・タイムスタンプなし約8〜9時間

長時間のセミナーや2時間のミーティングも、ファイルを分割せず一度に処理できます。


2つの処理モード

用途に合わせて、次の2モードが用意されています。
① 録音ファイル処理(Gemini 3.5 Transcribe) 録音済みのMP3やWAVなどの音声ファイルを渡して書き起こすモード。話者識別やタイムスタンプが必要な会議録音に向いています。

② リアルタイム処理(Gemini 3.5 Transcribe Live) マイクからの音声を1秒未満の超低遅延で文字起こしするモード。ライブ配信の字幕表示やAI音声アシスタントとの会話に適しています。

料金と無料枠

Gemini 3.5 Transcribeは、コストパフォーマンスの高さも魅力です。

API利用料金(従量課金) 録音ファイルの文字起こしは、音声1分あたり約0.003ドル(1時間で約27円程度)と非常に安価です。

無料枠(Free Tier) 「Google AI Studio」の無料枠を使えば、1日の利用制限の範囲内で完全無料で試せます。個人でのテスト利用やMVP(試作品)開発なら、無料枠だけで十分でしょう。


Gemini 3.5 Transcribeは、音声を文字にするだけでなく「そのまま使える美しいテキスト」へ自動で仕上げてくれる画期的なAIモデルです。

  • 議事録の修正作業に追われている方
  • 音声対応アプリを開発したいエンジニアの方

どちらにとっても、強力な味方になるはずです。Google AI Studioを使えば今すぐ無料で試せるので、手元の録音ファイルで精度を確認してみてはいかがでしょうか。

岡山のホームページ作成