第130回


会議の録音、インタビュー音声、動画ファイルを手軽にテキスト化したいと思ったことはありませんか。GoogleのAIアシスタント「Gemini」には、音声・動画ファイルをアップロードするだけでAIが内容を文字起こしする機能があります。専用の文字起こしソフトを用意しなくても、ブラウザやスマホアプリから手軽に使えるのが大きな特徴です。
Geminiの文字起こし機能は、単純に音声をテキスト変換するだけでなく、プロンプト(指示文)を工夫することで議事録形式への整形や話者の分離、要約の生成まで一括で行える点が他のツールとの大きな違いです。音声認識の精度が高く、日本語にも対応しているため、ビジネスシーンでの活用が急速に広がっています。
この記事では、GeminiのAI文字起こし機能の基本的な仕組みから始め、PCとスマホでの具体的な操作手順、精度を上げるプロンプト例、長い音声に対応するGoogle AI Studioの活用法、よくあるエラーと対処法、そしてビジネスでの実践的な活用方法までを詳しく解説します。
Google WorkspaceとGeminiを組み合わせることで、会議・インタビュー・研修など様々な場面の音声コンテンツを価値ある文書へと変換できます。ぜひこの記事を参考に、Gemini文字起こしを業務に役立ててください。

ここでは、Geminiの文字起こしの機能と特徴を整理します。
Geminiの文字起こし機能は、GoogleのマルチモーダルAI(テキスト・画像・音声・動画など複数の形式を同時に処理できるAI)の能力を活用したものです。音声や動画ファイルをGeminiにアップロードしてプロンプトで指示するだけで、AIが自動的に内容をテキストに変換します。
Geminiは単なる音声認識システムとは異なり、文脈を理解した上でテキストを生成するため、雑音の混じった音声でも意味のある文章として出力できます。また、専門用語や固有名詞も文脈から推測して補正するため、業界特有の言葉が多い会議音声でも比較的高精度な文字起こしが期待できます。
Geminiで文字起こしに使用できる主なファイル形式と制限は以下のとおりです。
| 項目 | 内容 |
|---|---|
| 対応音声形式 | MP3、WAV、FLAC、AAC、OGG、WEBMなど |
| 対応動画形式 | MP4、MOV、AVI、MKVなど主要動画形式 |
| ファイルサイズの上限 | Gemini標準:最大20MB程度(Google AI Studioでは最大2GBまで対応) |
| 音声の長さ | Gemini標準:数分〜十数分が目安(長尺はGoogle AI Studio推奨) |
| 対応言語 | 日本語・英語をはじめ多言語対応。混在音声にも対応可能 |
| 話者分離 | プロンプトで指示することで話者ごとの発言を区別して出力可能 |
ファイルサイズや音声の長さに制限があるため、長時間の会議録音などはGoogle AI Studioを使うか、音声ファイルを分割してから処理することを検討してください。
一方で、話者の固有名詞や業界特有の用語は誤変換されることもあります。変換後は必ず内容を確認・校正する習慣をつけることが重要です。

Geminiで文字起こしをする際、事前にどのような準備が必要なのでしょうか。以下、解説します。
Geminiで文字起こしを行うために必要なものは以下のとおりです。
Geminiは「gemini.google.com」にアクセスするか、スマホにGeminiアプリをインストールすることで利用できます。Gemini Advancedプラン(有料)では処理できるファイルサイズや高度な機能が強化されますが、基本的な文字起こし機能は無料プランでも利用可能です。
なお、Google Workspaceのアカウント(有料)を利用している場合は、管理者の設定によってGeminiの利用可否が異なります。組織のアカウントでGeminiが使えない場合は、システム管理者にご確認ください。
文字起こしの精度は、入力する音声ファイルの品質に大きく左右されます。より良い変換結果を得るために、以下のポイントを押さえて録音しましょう。
音声品質が高いほどAIの文字起こし精度も高まります。特に会議録音では、会議室の音響環境と録音機器の選択が文字起こし品質を大きく左右するため、重要な会議には外付けマイクの使用をおすすめします。

PCのブラウザからGeminiを使って音声・動画ファイルを文字起こしする手順を説明します。初めて使う方でも迷わず進められるよう、順を追って解説します。
まず、PCのブラウザで「gemini.google.com」を開き、Googleアカウントにサインインします。Geminiのチャット入力欄が表示されたら、入力欄の左下にある添付アイコン(クリップアイコンまたはファイルアイコン)をクリックしてください。
「ファイルをアップロード」を選択し、文字起こししたい音声ファイルまたは動画ファイルを選択します。ファイルがアップロードされると、入力欄にファイルのサムネイルが表示されます。この状態でプロンプト(指示文)を入力して送信ボタンを押してください。
Geminiがファイルを解析し、文字起こしの結果を出力します。処理時間はファイルの長さや複雑さによって異なりますが、5分程度の音声であれば数十秒〜数分で結果が表示されます。出力されたテキストはコピーしてGoogleドキュメントやスプレッドシートに貼り付けて活用できます。
プロンプトの書き方次第で、文字起こしの出力品質が大きく変わります。最も基本的なプロンプトは以下のような形式です。
「この音声を文字起こししてください。できるだけ正確に、発言内容をそのまま記述してください。」
シンプルな指示でも十分な文字起こしが得られますが、目的に合わせてプロンプトを工夫することで出力品質が向上します。次の章で具体的なプロンプト例を紹介します。

GeminiのスマホアプリはiOSとAndroidの両方に対応しており、外出先やスマホで撮影した動画の文字起こしにも活用できます。
App StoreまたはGoogle PlayからGeminiアプリをダウンロードしてインストールします。アプリを起動してGoogleアカウントにサインインしたら、チャット画面の入力欄下部にある添付アイコンをタップしてください。
「ファイルをアップロード」または「フォトライブラリから選択」をタップし、文字起こしたい音声ファイルまたは動画ファイルを選択します。ファイルがアップロードされたら、プロンプトを入力して送信します。
スマホで録音したばかりの会議音声や、動画アプリで撮影した動画をそのままGeminiに渡して文字起こしできるため、外出先での作業効率が大幅に向上します。文字起こし結果はそのまま共有したり、GoogleドキュメントアプリやGmailにコピーして活用できます。
Geminiアプリにはマイクアイコンが搭載されており、スマホのマイクで話しかけることで音声をリアルタイムでテキスト変換して入力できます。ただし、この機能はプロンプトをスムーズに入力するためのもので、長時間の会議録音には適しません。長い音声の文字起こしには、録音済みのファイルをアップロードする方法を使用してください。

Geminiの文字起こしをより高品質に仕上げるためには、プロンプトの工夫が重要です。プロンプトに出力形式・話者情報・用語の補足を加えることで、単純な音声認識ツールでは得られない精度と利便性を実現できます。以下に用途別のプロンプト例を紹介します。
「この音声ファイルをそのまま文字起こししてください。話し言葉をできるだけ正確に書き起こし、聞き取れない部分は【聞き取り不可】と記載してください。」
このプロンプトは最も基本的な文字起こしに適しています。聞き取れなかった箇所を明示するように指示することで、あいまいな変換ミスを防げます。
「この音声ファイルを文字起こしして、議事録として整形してください。以下の形式で出力してください。
なお、参加者の発言は内容を変えずに要約してまとめてください。」
会議の録音から直接議事録を生成したい場合に最適なプロンプトです。Geminiが音声の内容を解析しながら構造化した議事録として出力するため、手作業でまとめる時間を大幅に削減できます。
「この音声を文字起こししてください。複数の話者が登場します。話者ごとに発言を区別して、「話者A:」「話者B:」のように発言者を明示した形式で出力してください。発言者が切り替わる際は必ず改行してください。」
複数人が参加した会議や対談音声の文字起こしに有効なプロンプトです。Geminiは声質・話し方のパターンから話者を推定して区別しようとしますが、声質が似ている場合や複数人が同時に話している場面では誤りが生じることもあります。変換後は必ず確認してください。
「この音声を文字起こしします。音声は〇〇業界の社内会議で、以下の用語や固有名詞が頻繁に登場します。【用語・固有名詞のリスト:○○、△△、□□】。これらを正確に反映して文字起こしをしてください。」
業界特有の専門用語や自社の固有名詞をプロンプトに記載することで、誤変換を減らすことができます。製品名・サービス名・人名など、AIが初見の言葉ほど事前に伝えておくと効果的です。
「この音声ファイルについて次の2点を行ってください。
両方をわかりやすく区別して出力してください。」
文字起こしと要約を一度に依頼することで、原文の記録と概要の把握を同時に行えます。会議後のレポート作成や共有資料作成の効率が大幅に向上します。

Google AI Studio(aistudio.google.com)は、GeminiのAI機能を直接操作できる開発者向けプラットフォームですが、Googleアカウントがあれば無料で誰でも利用できます。通常のGeminiのチャット画面よりも大きなファイルを扱えるため、長時間の音声・動画ファイルの文字起こしにはGoogle AI Studioの利用が推奨されます。
Google AI Studioでは最大2GBのファイルをアップロードでき、長時間の会議録音や講義・セミナーの動画なども一括で文字起こしできます。Gemini 1.5 ProやGemini 2.0 Flashなどの高性能モデルを選択して使用できる点も特徴です。
ブラウザで「aistudio.google.com」にアクセスし、Googleアカウントにサインインします。「新しいプロンプト」をクリックして新しい作業画面を開いてください。左側のパネルにある「ファイルを追加」または入力欄のクリップアイコンから音声・動画ファイルをアップロードします。
ファイルのアップロードには数分かかる場合があります。アップロードが完了したら、入力欄にプロンプトを入力して「実行」ボタンをクリックします。長時間の音声であっても、Google AI StudioはGeminiの長いコンテキストウィンドウ(最大200万トークン)を活かして一括で処理できます。
Google AI Studioは一般のGeminiチャット画面よりも高度な使い方が可能ですが、業務利用の際はセキュリティポリシーの確認が重要です。Google Workspace向けにGeminiを利用している場合は、管理者が設定したポリシー内で利用してください。

Geminiを使った文字起こしを行う際、エラーや予期しない動作が発生することがあります。以下の表にケース別の原因と対処法をまとめました。
| 症状・エラー内容 | 考えられる原因 | 対処法 |
|---|---|---|
| ファイルアップロードができない | ファイルサイズが上限を超えている。対応していない形式 | ファイルを圧縮・分割するか対応形式に変換する。Google AI Studioを使用する |
| 「ファイルを処理できません」エラー | ファイルの破損、または音声トラックが存在しない動画ファイル | 別のファイル変換ツールで再エンコードする。別の音声ファイルで動作確認する |
| 文字起こし精度が低い・誤変換が多い | 音声品質が低い。雑音が多い。話者の声が聞き取りにくい | 音声をノイズ除去ツールで前処理する。プロンプトで専門用語を事前に伝える |
| 話者の区別がうまくできない | 複数人の声が重なっている。声質が似ている | プロンプトで話者の特徴を伝える。時間帯で手動分割して処理する |
| 出力が途中で止まる | 音声が長すぎてコンテキスト上限を超えている | 音声を複数ファイルに分割して別々に処理する。Google AI Studioに切り替える |
| 日本語と英語が混在して誤変換される | AIが言語を誤って判断している | プロンプトで「日本語と英語が混在しています。両方の言語をそのまま出力してください」と指示する |
| Geminiが文字起こし以外の回答を返す | プロンプトが曖昧でAIが意図を誤解している | 「この音声ファイルを文字起こしするだけにしてください」と明確に指示する |
エラーが発生した際は、まずファイル形式とサイズを確認し、プロンプトをより具体的に書き直すことで多くの問題が解決します。それでも解決しない場合はGoogle AI Studioへの切り替えを検討してください。

Geminiの文字起こし機能は、ビジネスのさまざまな場面で実務的な価値を発揮します。以下に代表的な活用シーンと具体的な使い方をご紹介します。
最も多い活用例が会議音声からの議事録作成です。会議をICレコーダーやスマホで録音し、終了後にGeminiへアップロードするだけで、発言内容を基にした議事録のドラフトが自動生成されます。担当者が手作業でメモを取る必要がなくなるため、会議中の議論への集中度が高まります。
生成された議事録ドラフトをGoogleドキュメントに貼り付けて、担当者が確認・修正を加えることで、従来の半分以下の時間で議事録を完成させられます。Google Workspaceのグループ機能と組み合わせることで、参加者全員への自動共有も容易に行えます。
記事制作や調査レポートのためのインタビュー音声を文字起こしする作業は、従来は非常に時間のかかる作業でした。Geminiを活用することで、1時間のインタビュー音声でも数分〜十数分で全文テキスト化できます。
プロンプトで「インタビュアーと回答者の発言を区別して出力してください」と指示することで、Q&A形式の文字起こしが得られます。そのままライティングの素材として活用したり、引用文として記事に組み込んだりすることが可能です。
社内研修やセミナーの動画・音声をGeminiで文字起こしし、テキスト教材として整備することができます。「この研修動画の内容を章立てして整理し、重要ポイントを太字で示してください」のようなプロンプトを使うことで、動画コンテンツをそのままテキストベースの学習資料へと変換できます。
新入社員向けの研修資料や、遠隔地のスタッフへの知識共有資料として活用できる点が大きなメリットです。Googleドライブに保存して共有ドライブで管理すれば、組織全体でアクセスできる教育コンテンツとして長期活用できます。
顧客との商談や電話応対の録音をGeminiで文字起こしし、CRM(顧客管理)ツールへの入力や報告書作成に活用できます。「この音声は営業担当者と顧客の商談です。顧客のニーズ・懸念点・決定事項を抽出して一覧化してください」のようなプロンプトを使うことで、重要情報を効率的に整理できます。
ただし、顧客との通話を録音する際は事前に同意を得ることが法令上の義務となる場合があります。個人情報保護法や各種ガイドラインに従い、適切に運用してください。
動画コンテンツの文字起こしは、アクセシビリティの向上にも貢献します。聴覚に課題を持つ方や、音を出せない環境でコンテンツを閲覧したい方が内容を把握しやすくなります。また、テキスト化することでSEO面での検索エンジンへの情報提供にも役立ちます。

GeminiのAI文字起こし機能は、音声・動画ファイルをアップロードしてプロンプトを送るだけで高品質なテキスト変換が行える、ビジネス現場に直結した実用的な機能です。プロンプトの工夫次第で、単純な文字起こしから議事録の自動生成・要約・話者分離まで幅広い出力が得られます。
この記事で解説した内容の要点を振り返ると以下のとおりです。
GeminiをはじめとするGoogle AIツールをGoogle Workspaceと組み合わせて最大限に活用したい場合は、ぜひサテライトオフィスへご相談ください。
サテライトオフィスはGoogle Cloudのプレミアパートナーとして、Geminiの導入支援・活用研修・Google Workspaceとのインテグレーション設定まで一貫して対応しています。「Geminiを使った業務効率化を進めたい」「組織全体でAIを安全に活用したい」といったご要望にも専門スタッフが丁寧にサポートします。まずはお気軽にお問い合わせください。
※プライバシーポリシはこちら