GPT Transcribe は、録音済みの音声を元の言語で文字に起こす、OpenAI 推奨の音声認識モデルです。アップロードした音声ファイルの一括処理、処理結果のストリーミング受信、Realtime WebSocket セッションで確定した発話単位の処理に対応します。会議、インタビュー、ポッドキャスト、サポート通話、調査録音などを検索可能なテキストにしたい場合に利用できます。
大切なのは正確なモデル名です。gpt-transcribe は gpt-4o-transcribe の省略ではなく、MP3 を受け付ける一般の ChatGPT モデルでもありません。OpenAI は、音声とテキストを入力、テキストを出力とし、文脈ヒント、多言語の案内、言語検出、ストリーミング対応を持つ、専用の高精度文字起こしモデルとして記載しています。この記事は、それらの能力が実務で何を意味するかと、別モデルがまだ正しい選択になる場所を説明します。
出典と製品詳細の確認は 2026年7月30日です。本番トラフィックを動かす前に、モデル提供、料金、上限、データ制御を開き直してください。
要点
- 元の言語のまま残したい完了録音には、まず
gpt-transcribeから始める。 - ファイルは
POST /v1/audio/transcriptionsへ送る。応答には書き起こしテキストと、モデルが信頼して検出できた言語が入る。 prompt、keywords、languagesは関連する文脈であり、内容を捏造する指示ではない。- 完了ファイルの書き起こしをストリームすることは、ライブマイクを途切れず文字起こしすることと同じではない。
- 話者ラベル、単語単位のタイムスタンプ、字幕ファイル、英語への翻訳には、専用モデルや専用 API を使う。
- 本番投入の前に、自分の音声で名前、数字、欠落、コードスイッチ、遅延、誤挿入を評価する。
GPT Transcribe とは何か
GPT Transcribe は自動音声認識モデルです。中核の仕事は会話モデルより狭いです。話し言葉の音声と任意のテキスト文脈を受け、書き起こしを返します。公式の GPT Transcribe モデルカード は、入力モダリティに音声とテキスト、出力モダリティにテキスト、対応エンドポイントに文字起こしと Realtime 文字起こしを載せます。
従来の音声認識では別工程になりがちな言語情報を、API リクエストで直接渡せる点が特徴です。録音内容の説明、登場しそうな固有名詞、想定する複数言語を指定できます。ただし、OpenAI はモデルカードで詳細なアーキテクチャや学習方法を公開していません。パラメータ数、データセット規模、デコーダー設計、あらゆる音声での精度を断定するのは推測になります。
実務の定義の方が役立ちます。
GPT Transcribe は、正確なファイル文字起こしと確定した音声ターン向けの、文脈を使える音声認識モデルです。JSON 優先の出力と、検出言語のメタデータを持ちます。
この定義は、よくある命名の誤りも防ぎます。gpt-transcribe、gpt-4o-transcribe、gpt-4o-mini-transcribe、gpt-4o-transcribe-diarize、gpt-live-transcribe、whisper-1 は別のモデル選択です。重なりますが、最適な手順と対応出力は同一ではありません。
OpenAI の音声認識スタックでの位置
OpenAI の現行文書は、音声の寿命と必要な出力に合うモデルから始めるよう勧めています。判断は「新しいモデル対古いモデル」だけではありません。
| 要件 | まず試す起点 | 理由 |
|---|---|---|
| 元の言語の完了録音 | gpt-transcribe | 一般のファイル文字起こし、文脈ヒント、検出言語、ストリームするテキスト出力 |
| 途切れず届くマイク、通話、メディア音声 | gpt-live-transcribe | 音声が届くときの低遅延文字起こし |
| 完了録音の話者ラベル | gpt-4o-transcribe-diarize | diarized_json で話者付き区間を返す |
| 単語または区間のタイムスタンプ | whisper-1 | verbose_json でタイムスタンプ粒度に対応 |
| ネイティブな SRT または VTT 字幕出力 | whisper-1 | 字幕の応答形式を直接サポート |
| 録音音声の英語への翻訳 | whisper-1 を /v1/audio/translations で | 音声を英語へ翻訳する専用 API |
この区別は見逃しやすいです。「ストリーミング」が二つの違うことを指すからです。完了ファイルはディスク上にすでにあり、API が部分的な書き起こしイベントをアプリへストリームできます。ライブ文字起こしは違います。マイクや通話の音声はまだ届いており、進行中の Realtime セッションを管理する必要があります。OpenAI の Whisper から GPT への移行ガイド は、ライブ音声とストリーム出力を別の判断として扱うよう明示しています。
モデルとその実務上の限界の、ブラウザ向けの短い説明としては、GPT Transcribe モデル概要 が API 文書の補助になります。
/v1/audio/transcriptions の動き
完了ファイルでは、接続は意図して単純です。アプリが音声ファイルを開き、multipart form data として送り、gpt-transcribe を選び、JSON を受けます。
curl --request POST \
--url https://api.openai.com/v1/audio/transcriptions \
--header "Authorization: Bearer $OPENAI_API_KEY" \
--header "Content-Type: multipart/form-data" \
--form file=@/path/to/meeting.mp3 \
--form model=gpt-transcribe成功応答には、テキストと検出言語の両方があり得ます。
{
"text": "Bonjour, can everyone see the AC-42 billing record?",
"languages": [{ "code": "fr" }, { "code": "en" }]
}言語検出は確率的なメタデータであり、呼び出し側が渡したヒントの必須エコーではありません。モデルが信頼できる予測をできないとき、空の languages 配列は妥当です。それだけでは、音声が無音だった、リクエストが失敗した、という意味にはなりません。
OpenAI の speech-to-text ガイド は現在、Transcriptions API のアップロードを 25 MB に上限し、MP3、MP4、MPEG、MPGA、M4A、WAV、WebM の対応を要約します。現行のエンドポイント参照は、さらに FLAC と OGG を載せます。ガイド要約とエンドポイントスキーマは別の時期に進むことがあるので、検証を実装するときは静的な形式一覧を永久の製品約束にコピーせず、Create transcription API 参照 を見てください。
文脈がモデルのいちばん重要な操作面
実際の録音には、聞き違えやすく、誤りが高い語が満載です。顧客 ID、薬品名、型番、人名、組織、略語、混在言語のフレーズです。GPT Transcribe は三種類の文脈を分けます。
prompt:録音を説明する
プロンプトは、場面や題材についての自由文の文脈です。役に立つプロンプトの例です。
A customer support call about enterprise billing and an account migration.
Preserve filler words because the transcript will be used for conversation research.モデルに録音の背景を伝えます。表記上の希望や、長い録音を分割した場合の直前部分の情報も渡せます。架空の書き起こしを例として入れたり、要約を求めたりしないでください。文字起こしと後処理は別の工程です。
keywords:登場しそうな語を渡す
キーワードは、録音に実際に出そうな語や句です。
["AC-42", "Premium Plus", "ZyntriQix", "SOC 2"]ヒントであり、必須出力ではありません。この区別は運用上大切です。用語リストは再現を上げられますが、無関係または過大なリストは、話されていない語へ認識を偏らせます。OpenAI はキーワード幻覚を明示的に評価するよう勧めています。音声が支えるときだけ、書き起こしにキーワードが出るべきです。
languages:想定言語を特定する
languages 配列は、多言語音声とコードスイッチを説明できます。現行文書は en、es、fr のような ISO 639-1、一部の ISO 639-3、zh-cn、zh-tw、zh-hk のような中国語地域ロケールを受け付けます。
これは移行の詳細でもあり、機能でもあります。gpt-transcribe は複数形の languages フィールドを使います。古いモデルは単数の language フィールドを使うことがあります。両方を送ってサーバが一つ選ぶと仮定しないでください。現行案内は、互換しない、または壊れた値を API が拒否すると書きます。

完了ファイルのストリームはライブ文字起こしではない
音声ファイルは完了しているが、処理が進むにつれて画面にテキストを出したいときは stream=true を設定します。GPT Transcribe は transcript.text.delta イベントを出し、transcript.text.done で終わります。
長いインタビューでは、体感の応答が良くなります。全文の準備より前に最初の段落が見え、アプリは保存、索引、下流の操作を有効にする明確な最終イベントを持てます。
/v1/audio/transcriptions を開いたマイクにはしません。ファイル全体がリクエストと一緒に渡されます。進行中の入力には、OpenAI は Realtime 文字起こしへ開発者を導き、途切れない低遅延作業には gpt-live-transcribe を勧めます。
この中間に当たる使い方もあります。アプリが発話単位で音声を確定したあとなら、gpt-transcribe を Realtime WebSocket の文字起こしセッションで利用できます。連続字幕よりも、区切られた発話ごとの精度を重視する場合に適しています。アプリは音声を追加してバッファを確定し、その発話の完了イベントまで差分テキストを受け取ります。
これで製品チームは三つの相互作用パターンを持てます。
- ブロックするファイル文字起こし: 完了録音を上げ、最終 JSON を待つ。
- ストリームするファイル結果: 完了録音を上げ、書き起こしデルタを描画する。
- Realtime 文字起こし: 進行中の接続で音声を送る。ライブモデルで連続するか、手動コミットしたターンか。
これらのパターンを正しく名付けると、あとの設計の驚きを防げます。
本番での精度の意味
音声認識に、正直な万能精度はありません。単語誤り率は、言語、アクセント、マイク距離、コーデック、雑音、重なり、語彙、話者の振る舞い、句読点や大文字を正規化する採点規則で変わります。きれいな英語ナレーションのベンチマークは、8 kHz 電話回線で録った二言語サポート通話の成績を予測できません。
したがって GPT Transcribe は、リーダーボードのラベルではなく、特定の手順の部品として評価します。利用者が実際に送る音声を代表する、許可された小さな評価セットを作ります。人が承認した参照書き起こしを残し、少なくとも三つの構成を比べます。
- いまの本番ベースライン。
- モデルだけの
gpt-transcribeへの切り替え。 - 関連する prompt、keyword、language ヒント付きの
gpt-transcribe。
合計の単語誤り率以上を測ります。
| 評価の軸 | 見るもの |
|---|---|
| 完全性 | 欠けた句、切れた末尾、小さい音量の飛ばし |
| 重要な実体 | 名前、数字、メール、薬品、SKU、口座 ID の完全一致 |
| 言語の振る舞い | 正しい文字体系、コードスイッチ、翻訳対原文、検出言語 |
| 頑健性 | アクセント、BGM、残響、重なる話者、電話音声 |
| ヒントの規律 | 渡したキーワードが、実際に話されたときだけ出るか |
| ストリームの振る舞い | 最初のデルタまでの時間、最終テキストまでの時間、部分改訂、イベント順 |
| 運用の耐性 | 空の音声、壊れたファイル、再試行、切断、重複送信の扱い |
精度を採点する前に、一般的なテキストモデルで評価対象の書き起こしを「改善」しないでください。後処理によって読みやすくなる一方、話者が実際に述べた内容が変わることがあります。逐語記録をそのまま保存し、追跡できる手順で清書版や要約を別に作成します。
GPT Transcribe が置き換えないもの
いちばん新しい既定が、すべての出力でいちばん機能の揃ったモデルとは限りません。
話者ダイアライゼーション
製品が「誰が何を言ったか」に答える必要があるなら、gpt-4o-transcribe-diarize を使います。diarized_json 応答は、話者、開始、終了のメタデータ付き区間を持ちます。30秒より長い録音では、OpenAI は自動または設定したチャンク戦略を求めます。モデルは既知の話者の少数について短い参照見本も受けられますが、Realtime 文字起こしセッションでは話者ラベルは対応しません。
単語タイムスタンプと字幕
GPT Transcribe の JSON 優先出力は、すべての Whisper 応答形式の置き換えではありません。編集者が単語タイムスタンプ、区間タイムスタンプ、SRT、VTT、verbose_json に依存するなら、whisper-1 を残すか、別のアライメントと字幕層を作って検証します。ファイル時間に語を均等配分してタイムコードを作らないでください。
翻訳
文字起こしは発話の言語を保ち、翻訳は別の言語へ変換します。録音済み音声を英語へ翻訳する OpenAI の API は、現在も whisper-1 の /v1/audio/translations です。それ以外の方法では、音声認識と翻訳を別工程にし、それぞれを確認できるようにします。
無制限の入力長
25 MB のアップロード上限は、尺の約束ではありません。圧縮したモノラル録音は、非圧縮ステレオ WAV より何分も多く収まります。より大きい入力は、適切に圧縮するか、意味の境目で分割します。文の途中で切ると音響と言語の文脈が消え、照合戦略のない重なりチャンクは語を重複させます。
費用とスループット
この記事の確認時点で、OpenAI の料金ページ に記載された gpt-transcribe の料金は 1分あたり $0.0045 でした。元音声1時間あたり約 $0.27 です。これには保存、ネットワーク、処理の制御、再試行、後処理、人による確認の費用は含まれません。
分あたりの価格は、本番費用の一部にすぎません。含めるものは次です。
- 失敗または繰り返したアップロード。
- メディア正規化とチャンク分割。
- 元ファイルと承認済み書き起こしの保管。
- 用語管理。
- 影響の大きい内容の品質確認。
- 下流の要約、検索、墨消し。
- 該当する場合のデータ所在地や企業制御。
安いモデルは、修正時間が増えれば高くなります。正確なモデルでも、ネイティブ字幕や途切れないライブ字幕が要る手順では誤った選択になり得ます。モデル行だけでなく、出力契約に対する手順全体の費用を比べてください。
プライバシーと責任ある扱い
録音は、ふつうのテキストより機微な情報を含むことが多いです。声、身元の手がかり、背景の会話、住所、健康、機密会議です。録音と処理の正当な権利を得て、集める量を最小化し、元ファイルを守り、削除予定を決めます。
OpenAI の現行 API データ制御ドキュメント は、顧客が明示的にオプトインしない限り、API データはモデル学習に使われないと述べます。エンドポイント表は /v1/audio/transcriptions を、アプリ状態の保持なし、不正監視の保持なし、Zero Data Retention の対象、と載せます。これらはプラットフォーム水準の記述であり、完全なプライバシープログラムではありません。アップローダ、オブジェクトストレージ、ログ、分析、サポートツール、下流の処理系は、それぞれ独自の方針と保持があります。
規制や高リスクの仕事では、責任を持つ法務とセキュリティチームと、現行の契約、地域、セキュリティ、人の確認要件を確認してください。人に実質的な影響を与え得る判断の唯一の記録として、自動書き起こしを扱わないでください。
本番向けの文字起こしアーキテクチャ

信頼できる実装は、取り込み、文字起こし、確認、派生コンテンツを分けます。
- 権限と取り込み。 利用者、録音の権利、メディア種別、ファイルサイズ、マルウェア制御を検証する。
- メディアの正規化。 非対応コンテナを変換し、必要なときは元コピーを残し、不要な非可逆再エンコードを避ける。
- 範囲を絞った文脈を付ける。 この仕事に関連する言語、キーワード、録音説明だけを選ぶ。
- 冪等に文字起こしする。 各元に安定したジョブ ID を付け、再試行が課金可能な重複や食い違う書き起こしを作らないようにする。
- 生の結果を保存する。 正確なモデル応答、モデル ID、文脈フィールド、元のチェックサム、処理日を残す。
- 重要な欄を確認する。 信頼の低い、または影響の大きい名前、数字、約束、医療・法務の言葉を人へ回す。
- 派生を作る。 承認済み書き起こしから、要約、章、キャプション、検索索引、墨消し版、次の行動を生成する。
- 保持を適用する。 文書化した方針に従い、元音声と派生を削除またはアーカイブする。
文字起こしも、双方向の音声手順の前半になり得ます。書き起こしを直したあと、チームはそれを改訂し、テキスト読み上げ でアクセシブルなナレーション、ローカライズ下書き、承認済みボイスオーバーを作れます。認識した元と生成した出力ははっきりラベルしてください。一方は話されたことの証拠、他方は新たに合成したメディアです。
API 接続とブラウザツール
文字起こしが製品、自動化、データパイプライン、繰り返しの内部過程の一部なら API を使います。認証、文脈、ジョブ追跡、下流保管、エラー処理を制御できます。
評価のために、最初から API 連携を実装する必要はありません。数本の代表的な録音で出力を確認したい場合や、SDK よりもファイルの書き出しを必要とする利用者には、ブラウザツールが役立ちます。GPT Transcribe のオンライン文字起こしツール では、自社の画面を作る前にアップロードと結果確認を試せます。
API とブラウザツールのどちらでも、評価基準は同じです。処理する権限のある音声を使い、人が作った正解データと比較し、固有名詞や数字を確認します。さらに、タイムスタンプ、話者ラベル、書き出し、保存をモデルとアプリのどちらが担うのかを明確にしてください。
GPT Transcribe を選ぶべきとき
gpt-transcribe を選ぶのは、次のときです。
- 入力が完了録音、または区切ってコミットしたターンである。
- 欲しい出力が、元の言語の正確なテキストである。
- 録音が想定言語のあいだで切り替わり得る。
- 分野語彙が、範囲を絞ったキーワードの恩恵を受け得る。
- 検出言語のメタデータが役立つ。
- 部分的な書き起こしイベントが、ファイル処理画面を良くする。
専用の代替を選ぶのは、次のときです。
- 音声が途切れず届き、低遅延が必須である。
- 話者をラベルする必要がある。
- 単語タイムスタンプまたはネイティブ字幕ファイルが必須である。
- 出力が英語翻訳でなければならない。
- 既存の接続が、
gpt-transcribeが出さない応答形式に依存する。
正しい選択は、必要な成果物に基づきます。「書き起こし」は、プレーンテキスト、検索できる JSON、映像に同期したキャプション、法廷風の話者記録、ライブ字幕を意味し得ます。すべて音声認識から始まっても、それらは別の製品です。
よくある質問
GPT Transcribe は GPT-4o Transcribe と同じですか?
同じではありません。gpt-transcribe は別の現行モデル ID であり、ふつうのファイル文字起こしについて OpenAI が勧める起点です。既存の gpt-4o-transcribe 接続は動き続けることがありますが、リクエスト欄、料金、出力の振る舞いが一致すると仮定しないでください。
GPT Transcribe は MP3 や動画ファイルを文字起こしできますか?
できます。ファイル文字起こしエンドポイントは、一般的な音声とメディアコンテナを受け付けます。現行の入力一覧と 25 MB のリクエスト上限は API 参照で確認し、特に FLAC、OGG、動画コンテナの検証時に見てください。
GPT Transcribe は話者を見分けますか?
単体ではしません。話者ラベル付き区間が要るときは gpt-4o-transcribe-diarize を使い、diarized_json を要求します。
SRT や VTT 字幕を作れますか?
GPT Transcribe のネイティブ出力の置き換えとしてはできません。OpenAI は現在、タイムスタンプとネイティブ SRT/VTT の手順を whisper-1 へ導くか、別に検証したアライメント層を作れます。
GPT Transcribe はライブマイク音声を処理できますか?
途切れず届く音声には、Realtime 文字起こし手順を使い、gpt-live-transcribe から始めてください。GPT Transcribe は WebSocket 上の手動コミットしたターンに使え、途切れないライブ字幕とは違います。
名前や専門用語の文字起こしを良くするには?
prompt で録音の背景を説明し、登場しそうな語を keywords で渡し、想定言語を languages に指定します。認識精度が上がる一方で、実際には話されていない語が挿入されないことも確認してください。
GPT Transcribe は無料ですか?
OpenAI API は利用課金です。確認日時点の公式料金は、gpt-transcribe を音声一分あたり $0.0045 と載せていました。第三者の画面は、独自の試験、クレジット、上限、定期課金を出すことがあります。
万能解ではなく、使える既定
GPT Transcribe は、OpenAI で新しく音声認識を実装するときの有力な第一候補です。録音済み音声の文字起こし、多言語の文脈、言語検出、処理結果のストリーミングを一つのモデルで扱えます。ただし、既存の方法をすべて置き換えるわけではありません。一般的な文字起こしには分かりやすい選択肢を提供し、特殊な出力には専用モデルを残しています。
先に必要な出力を定義してください。それから、利用者が送るいちばん雑音が多く、多言語で、用語の多い録音で gpt-transcribe を試してください。辿れる文脈、人の確認、正直な限界付きでそれらの事例を生き抜く書き起こしは、印象的なデモではなく、製品の一部になる準備ができています。

