OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话¶
Ch01.590 OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话¶
📊 Level ⭐⭐ | 10.5KB |
entities/openai深夜放出gpt-livechatgpt终于像真人一样说话.md
OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话¶
→ 原文存档
OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话¶
source: wechat source_url: https://mp.weixin.qq.com/s/w9dCLGw8tVDvRHsHXC73uQ
ingested: 2026-07-09
source_published: 2026年7月9日 08:05
OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话¶
机器之心编辑部
深夜,OpenAI 突然上线 GPT-Live。
这款新一代语音模型,把 ChatGPT Voice 往前推了一步:人与 AI 的交流开始更像一场真正的对话。
GPT-Live 基于全双工架构构建,也就是说,它可以同时听和说。在对话过程中,GPT-Live 可以用 mhmm 或 yeah 这样的回应表示自己正在听,也可以进行快速来回交流;当你需要一点时间思考时,它也会保持安静。最终带来的,是一种非常轻松自然的语音交互体验。
已关注
__
关注
__ 重播 __ 分享 __ 赞
关闭 __
观看更多
更多 __
__
__
__
退出全屏
切换到竖屏全屏 退出全屏
机器之心已关注
分享视频
__,时长 03:34
0/0
00:00/03:34
切换到横屏模式
继续播放
进度条,百分之0
__
00:00
/
03:34
03:34
全屏
__倍速播放中
您的浏览器不支持 video 标签
__
继续观看
OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话
观看更多 __
转载
,
OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话
__
机器之心 已关注
分享点赞在看
____已同步到看一看写下你的评论
__
OpenAI 表示,GPT-Live 是他们迄今最智能的语音模型。对于需要网页搜索、更深入推理或更复杂处理的问题,它会在后台交给这个最新前沿模型完成,并在结果准备好后带回对话中。在处理这些任务的同时,GPT-Live 仍然可以继续与你交流,维持对话的流畅性。
发布时,GPT-Live 后台调用的模型是 GPT-5.5。随着 OpenAI 后续推出新的前沿模型,GPT-Live 所调用的后台模型也会持续更新。
从今天开始,OpenAI 将在全球范围内向 ChatGPT 用户逐步推出两个版本的 GPT-Live,分别是 GPT-Live-1 和 GPT-Live-1 mini。
以往的语音 AI 路线
在 GPT-Live 之前,上一代语音 AI 系统已经让人机语音交互向自然对话迈进了一步,但不同技术路线都存在明显取舍。
一是级联式语音系统。
早期语音系统通常采用级联架构,也就是由多个模型依次完成一轮对话处理。最初的 ChatGPT Voice 就采用了这种方式:先由语音转文本模型将用户语音转写成文字,再由大语言模型生成回复,最后通过文本转语音模型把回复转换成语音。
这种架构让用户第一次能够通过语音与前沿 AI 模型交流,但多模型串联也带来了额外复杂性。信息在不同模型之间传递时可能发生损失,系统响应也容易显得缓慢、生硬。
轮次式语音模型。
此后的轮次式语音模型,例如 ChatGPT Advanced Voice Mode,开始在单一模型中处理和生成音频,降低了延迟,也让对话体验变得更顺滑。
不过,这类模型仍然遵循一来一回的轮次机制。模型需要等用户停止说话后才能开始回应,因此交互方式依然偏固定。同时,由于系统通常依靠静音来判断一轮发言是否结束,用户短暂思考时的停顿,或环境中的背景噪声,都可能被误判为发言结束,导致模型在不自然的时机插话。
GPT-Live 新方法
GPT-Live 通过两项架构变化,解决了上述局限。
持续交互。
首先,GPT-Live 基于全双工架构,为持续交互而设计。它处理的不是一条条彼此独立的消息,而是在生成输出的同时,持续处理输入。因此,模型可以在每秒内多次做出交互决策,包括是否开口、继续倾听、暂停、插话,或调用工具。
已关注
__
关注
__ 重播 __ 分享 __ 赞
关闭 __
观看更多
更多 __
__
__
__
退出全屏
切换到竖屏全屏 退出全屏
机器之心已关注
分享视频
__,时长 02:35
0/0
00:00/02:35
切换到横屏模式
继续播放
进度条,百分之0
__
00:00
/
02:35
02:35
全屏
__倍速播放中
您的浏览器不支持 video 标签
__
继续观看
OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话
观看更多 __
转载
,
OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话
__
机器之心 已关注
分享点赞在看
____已同步到看一看写下你的评论
__
这让模型能够进行更自然的来回交流,更好地把握时间节奏,甚至完成实时翻译。
面向深度任务的委派机制。
第 2 来源 — SWE-Bench Pro 审计 (AI寒武纪, 2026-07-08)¶
→ 原文存档
AI寒武纪文章补充了 GPT-Live 的架构细节和 SWE-Bench Pro 审计。
GPT-Live 采用全双工架构,每秒可做出多次决策(继续说话、倾听、暂停、打断或调用工具),实现持续交互而不是轮流发言。引入了任务委托机制:前台 GPT-Live 处理实时对话,后台 GPT-5.5 处理搜索/推理类深度任务,保证前台即时性的同时兼顾复杂处理。
提供即时、常规、高强度三种推理深度选项。版本方面,付费用户使用 GPT-Live-1,免费用户使用 GPT-Live-1 mini。部分地区首发版本在非英语语种下可能有口音问题,暂不支持视频和屏幕共享。
One more thing — SWE-Bench Pro 审计:OpenAI 审计了 SWE-Bench Pro,发现该基准在约 70% 的噪声上限处已饱和,不再可靠衡量前沿编码能力。OpenAI 因此撤回使用其作为领先编码评估。审计方法使用基于模型的调查员代理 + 五位独立经验丰富软件工程师的独立审查。
关联¶
- 相关概念: Harness Engineering