プロダクト発表 · 小互解読

OpenAIがGPT-Liveを発表——AIとの会話は交互に話す必要なし、難しい質問は自動でGPT-5.5に

聞きながら答える本物の音声モデルが本日ローンチ、複雑なタスクはリアルタイムでGPT-5.5に丸投げ可能に。
30秒で要点
  • OpenAIが次世代音声モデルGPT-Liveを発表。全二重(フルデュプレックス)アーキテクチャを採用し、音声を生成しながら入力を継続処理、聞きながら話す自然な会話を実現。
  • ウェブ検索、深い推論、複雑なタスクが必要な場面では、GPT-Liveがバックグラウンドで動くGPT-5.5にリアルタイムで処理を委任、こちら側の会話は途切れない。
  • GPT-Live-1とGPT-Live-1 miniの2バージョンをリリース、本日より全世界のChatGPTユーザーに展開:Go / Plus / Proはデフォルトで GPT-Live-1、FreeユーザーはデフォルトでminiバージョンAns使用。
  • 人間による直接比較評価では、GPT-Live-1もminiもAdvanced Voice Modeより明確に好まれる結果に。GPQA、BrowseComp、τ³-Voice Telecomの3つの評価でもすべて後者を上回った。
  • 音声に天気・株価・スポーツなどのビジュアルカードを新搭載、推論強度も調整可能(Instant / Medium / High)。自傷や感情的依存など、音声シーン特有の安全対策も強化。
本記事はOpenAI公式発表ブログの解説です。文中の評価結果、選好データ、安全性テストの結論はすべてOpenAIの自己評価および社内テストの基準によるもので、第三者による独立検証はまだありません。
1発表

OpenAIがGPT-Liveを発表:音声対話がもう交互に話さなくてよくなる

OpenAIは2026年7月8日、新世代音声モデルGPT-Liveを発表し、ChatGPT Voiceの新世代基盤モデルとして本日より全世界のユーザーに公開した。

GPT-Liveがもたらす変化は、AIと話すときにもう交互に話さなくてよくなること。聞きながら話す、話しながら答えることができ、話している途中でも割り込んだり質問を重ねたりできる。ウェブ検索や思考が必要な難問にぶつかると、こっそりバックグラウンドのより強力なGPT-5.5に処理を任せ、こちらの会話は途切れない。

注目すべき理由:これまでのAdvanced Voice Modeは話し終わるのを待ってから応答していたが、GPT-Liveは全二重アーキテクチャで聞きながら話すことを実現。GPQA、BrowseComp、τ³-Voice Telecomの3つの評価すべてでAdvanced Voice Modeを上回った。本日よりGPT-Live-1とGPT-Live-1 miniの2バージョンが全世界に展開される。

OpenAI公式デモ動画(中英字幕):GPT-Liveと「おばあちゃん」役との実際の音声対話。聞きながら話す、いつでも割り込める、静かに待つといった全二重の特性を示すもの。出典:OpenAI『Introducing GPT-Live』
あなたの声AIの声

2本の音波が同時に起伏し互いを邪魔しない、これが全二重対話の姿だ。

2旧方式

旧方式の限界:バケツリレーは情報を失い、交互発話は話を奪う

GPT-Liveの何が新しいかを理解するには、まず過去2世代の音声方式がどこで詰まっていたかを知る必要がある。どちらもAIと対話はできるが、それぞれに気になる欠点があった。以下の3つのアーキテクチャを並べて見るのが一番わかりやすい。

第1世代
3つのモデルの
バケツリレー(カスケード方式)
音声入力 音声をテキスト化 AIが答えを考える テキストを音声化
各ステップが前のステップの完了を待たねばならず、口調やトーンが引き継ぎの際に失われがちで、応答が遅く不自然になる。
第2世代
1つのモデルで送受信、
でもまだ交互発話
1つのモデルが
同時に送受信
無音を検知
=話し終えたと判断
ようやく応答
速くて滑らかにはなったが、一度に一方しか話せない。少し考えて間が空いたり、周囲に雑音があったりすると「話し終わった」と誤判定され、話を遮られてしまう。
GPT-Live
聞きながら話す
(全二重)
継続的に聞く 継続的に応答 毎秒何度も判断
聞くことと話すことが同時に進行し、話すべきか、聞くべきか、待つべきか、割り込むべきかを常に判断する。前の2世代の弱点を補う。仕組みの詳細は次の2セクションで説明する。
たとえるなら · カスケード方式

リレー走のようなもの。音声のテキスト化、AIの回答生成、テキストの音声化という3人の走者がバトンを渡すたびに落とす可能性があり、それはつまり、あなたの発言の中の情報が少しずつこぼれ落ちるということだ。

同じ「ねえ、ちょっと話せる?」という一言が、3世代のアーキテクチャでどう聞こえるか、OpenAIが公式に実録音を公開しており、直接聴き比べられる。

第1世代 · カスケード方式
応答が遅く不自然で、長い間が伴う。(標準音声モード、GPT-5.5 Instantを使用)
第2世代 · ターン制(AVM)
速度と滑らかさは向上したが、複数ターンのやり取りではまだぎこちない。(ChatGPT高度な音声モード)
GPT-Live · 全二重
応答が速く自然で表現力豊か、聞く姿勢もより集中している。(GPT-Live-1、GPT-5.5 Instantを使用)
3突破点1 · 全二重

突破点1:1つのモデルが聞きながら話す、話し終わるのを待たない

GPT-Liveの最初の変更点は、継続的な会話のために専用の全二重アーキテクチャ(full-duplex、同時に聞くことと話すことができることを指す)を構築したことだ。会話をひとつずつ分かれたメッセージに分割するのではなく、入力を継続的に処理しながら、応答を継続的に生成する。

核心のイノベーション

聞くことと話すことが同時に進行するため、モデルは毎秒何度も判断できる:今話すべきか、聞き続けるべきか、少し止まるべきか、割り込むべきか、ツールを呼び出すべきか。その結果、より自然なやり取り、より良い間合い感覚がもたらされ、リアルタイム翻訳すらこなせるようになった。

OpenAI公式デモ動画(中英字幕):OpenAI社員が「常に在席」能力を解説し、ハンドドリップコーヒーを淹れながらGPT-Liveに時間を知らせ続けてもらう実演。マルチステップのタスクでもモデルはずっと付いてきて、いつでも応答できる。出典:OpenAI『Introducing GPT-Live』
たとえるなら · 全二重

トランシーバーは一度に一人しか話せず、もう一方は待たねばならない。電話は両者が同時に割り込め、いつでも相手の話を受け止められる。全二重音声モデルとは、AIをトランシーバーモードから電話モードに切り替えるようなものだ。

トランシーバーモード · 旧版

あなたが話す → 手を離す → やっとAIが話す → 話し終わる → やっとあなたの番。途中で少し間が空くと「話し終わった」と誤判定され、割り込まれてしまう。

電話モード · GPT-Live

あなたが話している間もAIは聞いて判断している。あなたが立ち止まって考えていれば静かに待ち、あなたが合図すれば話し始める。「うん」「わかった」といった相槌で聞いていることを伝えてくれる。

OpenAI公式デモ動画(中英字幕):GPT-Live-1(バックエンドはGPT-5.5 Instant)が聞きながら話す実際の対話サンプル。上のトランシーバーモードとの違いを直接体感できる。出典:OpenAI『Introducing GPT-Live』
全二重アーキテクチャでは、モデルが毎秒繰り返しこれらを判断する
話す 聞き続ける 少し待つ 割り込む ツール呼び出し
4突破点2 · 委任

突破点2:日常会話は自分でこなし、難題はより強いモデルに任せる

2つ目の変更点は、「一緒に話す」ことと「重い仕事をこなす」ことを切り分けたことだ。GPT-Liveは継続的な対話に専念する。ウェブ検索、推論、一連のagentic操作が必要な問題に遭遇すると、別のより強力なモデル、つまり発表時点で使われているGPT-5.5このバックエンドエンジンは固定ではない。今後OpenAIがより強力なフロンティアモデルを出せば、GPT-Liveの背後で接続されるものも新しいものに切り替わる。インタラクション層は作り直さなくてよい。に、その難題を委任する。委任している間もこちらの会話は続き、結果が出たら会話に戻して繋げる。

核心のイノベーション

具体的なシナリオで見てみよう:運転中に音声でChatGPTに「明日の北京発上海行きのフライト、まだ空席あるか調べて」と尋ねる。これはウェブ検索が必要な作業なので、GPT-Liveは一方で会話を続けながら、もう一方でバックグラウンドのGPT-5.5にタスクを投げ、バックグラウンドの検索が終わったら答えを会話に接続する。その間、あなたはずっとつっかえを感じない。

前段 · GPT-Live(会話は途切れない) 後段 · GPT-5.5(ウェブ検索 · 推論) あなたが質問 「明日のフライト、 空席ある?」 GPT-Liveが会話継続 「調べるね、 大体何時出発?」 GPT-Liveが結果を報告 「まだ3便空きあり、 一番早いのは8時」 会話は継続 GPT-5.5 ウェブでフライトの空席検索 タスク委任 結果を持ち帰る
全編、会話が途切れない:バックグラウンドでフライトを調べているこの数秒間、前段のGPT-Liveは止まらず、まだあなたに出発時間を確認している。調べ終わったら自然に会話に接続し、結果を伝える。この分業のおかげで、GPT-Liveのバックエンドエンジンは今後の新モデルに合わせて継続的にアップグレードできる。
実際の対話録音 · 深いタスクの委任
GPT-Liveが素早く自然な応答を提供する一方、GPT-5.5がバックグラウンドで検索タスクを処理する。(GPT-Live-1、GPT-5.5 Instantを使用)出典:OpenAI『Introducing GPT-Live』
5評価結果

評価結果:会話体験も専門的な質問も旧バージョンより優れている

OpenAIは今回の発表のために新たな人間評価を実施し、会話が快適か、スムーズかを測定した。さらにいくつかの汎用能力評価でもAdvanced Voice Modeとの比較を行った。以下の結果はすべてOpenAI公式の基準による。

人間による直接比較評価の方法:5〜10分の対話をしてもらい、全体的な選好、ターンの取り方、割り込み、スムーズさ、自然さの5つの観点から比較し、対話ごとにGPT-LiveとAdvanced Voice Modeのどちらが好まれるかを見る。

全体的な選好ターンの取り方割り込み処理スムーズさ自然さ

直接比較での選好率(50%はAVMと互角):

GPT-Live-1
75.7%
GPT-Live-1 mini
69.2%

さらに個別採点による対話評価テスト(満点7点、対話のスムーズさと全体的な快適さをカバー)もある:

モデル対話のスムーズさ快適さ
GPT-Live-14.965.19
GPT-Live-1 mini4.334.47
Advanced Voice Mode3.803.82

以下の3つの汎用評価は音声用に設計されたものではなく、モデル自体の能力を測るもの。比較対象は同じくAdvanced Voice Mode:

GPQA
生物、化学、物理にまたがる専門家レベルの科学推論を測る。
BrowseComp
ネット上で見つけにくい資料を探す能力(agenticなウェブ検索)を測る。
τ³-Voice Telecom
OpenAI社内で構築した評価。音声agentに実際の、複数ターンにわたる電話カスタマーサポートのタスクを処理させる。

GPQA正解率、バックエンドが接続する推論強度別:

AVM
45.3%
GPT-Live-1 mini
74.9%
GPT-Live-1 · Instant
76.5%
GPT-Live-1 · Medium
81.7%
GPT-Live-1 · High
84.2%

BrowseComp正解率:

AVM
0.7%
GPT-Live-1 mini
31.6%
GPT-Live-1 · Instant
35.1%
GPT-Live-1 · Medium
60.6%
GPT-Live-1 · High
75.2%

τ³-Voice Telecomの評価はタスク完了率と所要時間を同時に見る。推論強度が高いほど正確だが遅くなる:

モデルタスク所要時間中央値タスク成功率
AVM385.5秒29.5%
GPT-Live-1 mini290.9秒39.5%
GPT-Live-1 · Instant231秒37.3%
GPT-Live-1 · Medium295秒59.6%
GPT-Live-1 · High386秒63.4%
バックエンドが接続するエンジン:GPT-Live-1(instant)とminiはバックエンドのGPT-5.5 Instantを使用;GPT-Live-1 MediumとHighはGPT-5.5 Thinkingを使用し、それぞれ中・高の推論強度を設定。τ³の評価はOpenAI最新の推論モデルで駆動するカスタムユーザーモデルを使って実施、データはすべてOpenAI公式の基準による。
6実際に使うと

ChatGPT音声を開くと、今どんな変化を感じられるか

毎週1.5億人以上がChatGPTの音声・ディクテーション機能を使い、ハンズフリーの日常アシスタントとして、外国語練習として、寝る前の物語として、あるいは通勤中の何気ないおしゃべりとして活用している。今日から、音声ボタンを押して話すと、使われるのはGPT-Liveだ。

OpenAI公式デモ動画(中英字幕):数名のOpenAI社員がこのモデルについて語り、実際の2つのシーンを挟んでいる。ハンズフリーで口述してオファーの返信文を修正するシーン、踊りながら手を止めずに音声で何かを調べるシーン。出典:OpenAI『Introducing GPT-Live』
OpenAI公式デモ動画(中英字幕):ChatGPT音声ボタンを押した後の実際の起動体験。出典:OpenAI『Introducing GPT-Live』
1.5億+ /週
毎週ChatGPT音声・ディクテーション機能を使う人数
2バージョン
GPT-Live-1(Go / Plus / Proでデフォルト)とmini(Freeでデフォルト)
9種の音色
今回すべて新たに作り直された音声トーン
GPT-5.5
バックグラウンドで深いタスクを処理するフロンティアモデル(Instant / Thinking)

より人間らしい対話、聞き取りもより上手に

いつでも割り込んで質問したり、立ち止まって考えを整理したり、ゆっくり話すよう頼んだりできる。「うん」「わかった」といった相槌でついてきていることを示してくれる。9種の音色もすべて新たに作り直された。

旧版 · あなたが間を置いたとき

言葉を選んでいるだけなのに、話し終わったと誤解され、そのまま割り込まれてしまう。

GPT-Live · あなたが間を置いたとき

静かに待ち、慌てて割り込まない。まず黙って聞いていてと頼めば、その通りにする。車の走行音や周囲の話し声のような雑音があっても、あなたの声により集中できる。

必要なときはより賢い答えを

音声は今、最新のフロンティアモデルを呼び出せるようになり、自分で推論強度を選べる:速さが欲しいならInstant、もっとよく考えてほしいならMediumかHigh。

Instant
最速の回答、日常のちょっとした質問に向く。
Medium
少し時間をかけて考える、速度と深さのバランス型。
High
じっくり考えてほしいときに、思考時間が最も長い。
OpenAI公式デモ動画:音声対話内で推論強度(Instant / Medium / High)を選択する実際のインターフェース。出典:OpenAI『Introducing GPT-Live』

見える答えのほうが役立つこともある

話している最中、ChatGPTは今、天気、株価、スポーツのスコアなどのカードを直接見せてくれる。わざわざ文字入力で確認しなくてよい。音声は引き続き検索、メモリー、画像・ファイルアップロードにも対応。

OpenAI公式デモ動画(中英字幕):荷造りをしながら「今週のメキシコシティの天気を見せて」と聞くと、ChatGPTが天気カードを直接表示。手を止めて文字入力で確認する必要がない。出典:OpenAI『Introducing GPT-Live』

さらにOpenAI公式が提供した実際のスクリーンショットを2枚:

ChatGPT Voiceが直近の国際サッカー試合スケジュールカードを表示
スポーツ試合スケジュールカードの例
ChatGPT Voiceが近くのバーの地図カードを表示
地図カードの例(近くで観戦できるバー)
7安全性

音声シーン専用の安全設計

GPT-Liveは最新モデルの安全基盤の上に、音声というこの新しい形式に向けて、専用の安全トレーニングと防護策を追加している。

実際の使用によりマッチした安全テスト

OpenAIは安全テストを音声ネイティブな評価にまで拡張し、さらに合成音声で一連のテストを作成し、いくつかの重要なリスクに的を絞った。社内の専門家に音声特有のリスクについてレッドチームテストも実施させた。原文によれば、ほぼすべての評価領域でGPT-Liveの表現はAdvanced Voice Modeと同等かそれ以上だという。重点的に注視したリスクは以下を含む:

自傷精神症状と躁状態AIへの感情的依存暴力性的コンテンツ

発話中に介入できる防護

音声対話はリアルタイムに進行するため、OpenAIはモデルが話している最中にも機能する防護策を用意した。システムが安全でない可能性のあるコンテンツを検知すると、次の3つのうちどれか1つを実行できる:

アクション1
モデルをより安全な回答へと誘導する
アクション2
追加の安全ガイダンスや支援リソースを補足する
アクション3
リスクがより高い場合は、その音声対話を直接終了する

自傷に関わる対話については、OpenAIはChatGPTのサポートフローを音声版に適合させ、専門家によって審査された危機ホットラインのサポートを含めている。

ティーンエイジャーと声の保護

ティーンエイジャーのユーザー向けに、モデルのトレーニングには年齢に適した振る舞いが組み込まれている。保護者はParental Controlsを通じて、子どもがChatGPT音声を使えるかどうかを決められる。自傷や自殺の意図を示す兆候がある高リスクな状況では、関連する保護者に通知が届く場合がある。さらに、GPT-Liveは防護のかかった、実在の人物を模倣しない一連のプリセット音声のみを使用する。

8提供開始

今すぐ使えるか:対応範囲と制限

GPT-Liveは本日より全世界のChatGPTユーザーに展開され、iOS、Android、ChatGPT.comをカバーする。各プランでデフォルトで使われるバージョンは、以下の階層図を参照。

GPT-Live-1Go / Plus / Proでデフォルト
標準版。Go、Plus、Proユーザーのデフォルト音声モデルになる。
GPT-Live-1 miniFreeでデフォルト
軽量版。Freeユーザーのデフォルト音声モデルになる。
旧版 Standard / Advanced Voice Mode
引き続き手動で切り替え可能。音声と動画やスクリーン共有の組み合わせなど、GPT-Liveがまだ対応していない機能は、旧版で引き続き利用できる。

現段階でのいくつかの制限も知っておく価値がある:GPT-LiveはChatGPTで最も人気の高い言語群に最適化されており、一部の言語ではまだ非ネイティブなアクセントが残っていたり、流暢さが足りなかったりする場合がある。OpenAIは改善中だとしている。提供開始時点では音声と動画・スクリーン共有の組み合わせにはまだ対応しておらず、これらの機能は近日公開予定。APIも近日開放予定で、開発者と企業はフォームに登録して通知を待つことができる。

  • 日常の音声での質問応答、外国語練習、通勤中の雑談で、割り込み、立ち止まって考えること、ゆっくり話すようにという要求が自然に認識されるようになり、頻繁に話を奪われたり誤判定されたりしなくなる。
  • ウェブ検索が必要な資料調べ、専門的な科学の質問、複雑なマルチステップのタスクに遭遇しても、音声対話は深いモデルに近い精度を得られる。背後でGPT-5.5がリアルタイムに処理しているためだ。
  • 天気、株価、スポーツのスコアなどの情報を調べるとき、音声対話の中で直接ビジュアルカードを見られ、わざわざ文字入力で確認する必要がない。
  • 保護者はParental Controlsを通じてティーンエイジャーが音声機能を使えるかどうかをコントロールでき、自傷・自殺の意図に関わる高リスクな対話は関連する保護者に通知される。
GPT-Liveは全二重アーキテクチャの上に構築されており、これは同時に聞くことと話すことができることを意味する。ウェブ検索やより深い推論、より複雑な作業が必要な問題については、舞台裏で私たちの最新のフロンティアモデルに委任し、結果が整ったところで会話に持ち帰る。 OpenAI、『Introducing GPT-Live』、2026年7月8日
本記事はOpenAI公式発表ブログ『Introducing GPT-Live』(2026年7月8日)をもとに整理・解説したものです。文中の評価データ、選好結果、安全性テストの結論はすべてOpenAI公式の基準によるもので、第三者による独立検証はまだありません。原文リンク:openai.com/index/introducing-gpt-live/