腾讯PCG联合深圳河套学院:在全双工语音大模型领域取得重要突破,获 ACL 2026 杰出论文奖¶
Ch01.993 腾讯PCG联合深圳河套学院:在全双工语音大模型领域取得重要突破,获 ACL 2026 杰出论文奖¶
📊 Level ⭐⭐ | 6.5KB |
entities/腾讯pcg-lychee-fd全双工语音大模型-acl2026.md
腾讯 PCG 联合深圳河套学院:Lychee-FD 全双工语音大模型获 ACL 2026 杰出论文奖¶
腾讯技术工程报道:腾讯 PCG 技术线-AI 创新应用中心联合深圳河套学院 AI 训练平台张民教授团队、香港中文大学(深圳)李海洲教授团队,凭借全双工语音大模型研究《Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs》斩获 ACL 2026 杰出论文奖(Outstanding Paper)。本届 ACL 共收到投稿逾 1.2 万篇(12,148 篇),主会录用率约 19%,杰出论文仅 18 篇(获奖率 0.15%)。团队研发的原生端到端全双工语音大模型 Lychee-FD 不仅在多个全双工语音交互基准上达到业内领先水平,还首次揭示了原生全双工语音大模型长期难以兼顾交互流畅度、语义理解能力与推理效率的根本原因。
问题:为什么过去的语音交互总是不自然¶
现有语音 AI 大多停留在"一问一答、听完再说"的轮次式交互范式;OpenAI 发布的 GPT-Live 将实时语音交互推至聚光灯下,印证了语音交互从轮次式问答走向连续、双向、实时自然交流的趋势。真正的难点不只是让系统"看起来可以被打断",而是让持续倾听、语义理解、语音生成和节奏控制成为模型内部原生具备的能力。行业中的系统级全双工方案是在传统语音链路外部增加打断检测、状态判断和调度模块,但级联架构带来延迟、生硬的轮次切换,且听、想、说、控节奏被拆散,语音理解与表达难以真正统一。Lychee-FD 走的是原生端到端全双工路线:把持续倾听、语义理解、语音生成和对话节奏控制统一注入大模型内部。
科学洞察:揭示原生全双工"降智"的根本原因¶
论文通过细粒度的优化动态分析发现两个内生病因。其一是深层梯度冲突:当声学建模和语义建模被迫共享同一套深层参数空间时会出现内生的梯度冲突——浅层网络中语音和文本目标仍可协同,进入深层后优化方向开始分化甚至互相牵制。其二是语义稀释:语音信号频率(约 25Hz)远高于文本语义信号(约 3Hz),传统对齐方式要用大量填充 token(padding)补位,导致文本序列中 80% 以上都是无意义的 padding,稀疏的文本监督被高频声学信号淹没,模型逐渐偏向"复现声音"而削弱语义逻辑保持。这解释了为什么原生全双工语音大模型长期难以同时做到"聪明、自然、低时延"——问题不只是工程不够快,而是模型内部的语音生成和语义推理本身存在深层冲突。
架构创新与工程实现¶
团队提出层次化语义-声学建模框架:浅层保留共享主干让语音和语义共同学习底层表示,深层将语义、声学和对话控制拆分为不同的专门通道(语义通道保持语言理解和知识能力、声学通道生成自然语音、对话控制通道判断开始/停止/交互节奏),并引入密集语义对齐通道(内部独白)让模型生成语音的同时保留清晰连续的"内部语义线索"。实验结果:Lychee-FD 在 Spoken QA 任务上平均提升 7.4%,在 FullDuplexBench 1.5 上平均提升 28.5%,在 3 个全双工语音交互基准的 10 个指标上达到当前领先水平。工程上团队以 vLLM 为推理底座开发实时并行多流推理框架:共享主干计算完成后将中间表示分发到语义、声学和控制通道并行执行并分别管理多流 KV cache,相比基础框架提速 2.96 倍、GPU 显存占用降低 23%;还提出控制头早退策略,让控制 Token 更早产出,为打断响应提供"快速通道"。
Lychee-FD 的全双工能力不是外挂的打断模块,而是被内化到模型架构中的原生交互能力,完成了从科学洞察、架构创新到在线推理引擎优化的全栈闭环。这与 OpenAI 实时语音架构 的对比很有价值:OpenAI 的 GPT-Live 走实时语音前端/后端分工路线,而 Lychee-FD 主张把全双工能力内化进单一模型——两种路线在 GPT-Live 实时语音前端与后端委托 的设计决策上给出了相反取舍;VoiceEQ 评测(Voice Agent 评测)中"说强于听"的问题,恰是 Lychee-FD 用"语义-声学解耦 + 内部独白"试图从架构上解决的。
ACL(Association for Computational Linguistics,国际计算语言学协会年会)迄今 64 届,是 NLP 领域历史最悠久、学术地位最高的国际顶会,被中国计算机学会(CCF)列为 A 类推荐会议、国际 CORE 评级体系列为 A 等级;ACL 获奖论文通常直接代表产业落地能力,历届获奖均在翻译、语音、大模型等方向留下重要印记。本次获奖也延续了 ACL 2026 中文社区的高光表现(见 Luma Uni 1.1 等中文社区进展 语境下的产业落地叙事)。
→ 原文存档