
网易有道开源了子曰4-R2T2和子曰4-T3PO两款同传模型,前者是低延迟流式ASR模型,平均延迟200-600毫秒;后者是140亿参数流式翻译模型。两者组合可实现超快语速的实时语音翻译,并推出终身免费的语音Agent网易叭哥说。
在语音交互领域,延迟、准确率与流畅度长期被视为难以兼顾的三角。传统方案往往需要在三者之间做出取舍:降低延迟可能牺牲识别质量,追求高精度则难免引入可感知的停顿。网易有道近期在其 AI Open Day 上发布并开源的两款同传模型——子曰4-R2T2 与子曰4-T3PO,试图用流式架构打破这一僵局。
从技术路径看,R2T2 是一款真流式自动语音识别(ASR)模型,其核心突破在于将平均延迟压缩至 200 至 600 毫秒区间,同时在多个基准测试中达到开源模型的最先进水平(SOTA)。这一成绩的取得,依赖于稳定前缀数据构建、强制时间对齐以及词元级音频分割等训练策略,并引入了最长稳定前缀(LSP)学习范式。即便在流式输出条件下,该模型在离线识别场景中仍保持了较高的准确率。
与之配合的 T3PO 则是一个拥有 140 亿参数的文本到文本同步机器翻译(SiMT)模型。它同样采用全流式输出,并允许用户根据场景在低延迟与高质量之间调节模式。值得注意的是,T3PO 可与外部流式 ASR 模型联动,形成从语音到文本的完整实时转换链路。现场演示中,一段超快语速的语音被清晰、迅速地翻译为中文,展现了组合方案在极端输入条件下的稳定性。
在模型开源之外,网易有道同步升级了办公 Agent 应用 LobsterAI 至 2.0 版本。新版本在开源项目兼容与团队共享方面进行了改进,并全面兼容 OpenClaw 2.0。这一动作表明,有道正在将底层语音能力与上层办公场景进行更深度的耦合。
更值得关注的是网易首个 AI 原生语音 Agent「网易叭哥说」的发布。该产品定位为「从语音转文字走向语音转意图」,在识别之后继续做语义理解,将口语中的重复、停顿、改口整理为可直接使用的文字,适用于聊天、邮件、文档等场景。官方称其支持 100 多种语言的实时互译,在计算机、金融、医学等垂直领域翻译准确率可达 98% 以上,并承诺终身免费。隐私方面,声音仅在本地处理,不上传、不记录,也不用于模型训练。目前 Mac 与 Windows 桌面端已全量上线,移动端仍在开发中。
据网易有道 CEO 周枫披露,有道 AI 同传累计服务用户已超过 2500 万,使用次数同比增长近一倍;口语学习产品 Hi Echo 用户突破 1000 万;办公 Agent LobsterAI 用户规模突破 100 万,活跃用户次日留存超过 80%。
Hi Echo 此次升级为 Agent 口语私教,采用端到端全双工语音对话,支持随时打断,并能识别对话中的语气与情绪。系统从首次对话开始评估用户水平,据此生成学习计划并动态调整,底层依托有道自研的 Helix 目标驱动型自进化学习系统。场景覆盖口语考试、商务谈判与求职面试,新版计划于下周上线应用市场。
如果将视野拉宽,网易有道的开源动作并非孤立事件。国内语音 AI 赛道正在形成多层次的竞争格局:科大讯飞在语音识别与合成领域长期积累,其星火认知大模型已融入翻译与办公场景;阿里通义千问、字节豆包、月之暗面 Kimi 等则在多模态交互与长文本理解上持续迭代。与 OpenAI 的 Whisper 系列、Google 的 USM 等海外方案相比,国内厂商在中文及多语种实时同传的垂直场景中往往更注重端侧部署与隐私保护,网易叭哥说的本地化处理策略即是一例。
从开源生态角度看,将同传模型以开源形式释放,有助于吸引开发者基于其构建更多实时语音应用,这与 Meta 的 Llama 系列在文本领域的策略有相似逻辑。但语音场景对延迟的敏感度远高于文本,开源模型能否在真实网络环境中保持 200 毫秒级的响应,仍需社区验证。
网易有道发布并开源了子曰4-R2T2 和子曰4-T3PO。前者是真流式自动语音识别(ASR)模型,平均延迟 200 至 600 毫秒;后者是 140 亿参数的文本到文本同步机器翻译(SiMT)模型,支持全流式输出与延迟模式调节。
网易叭哥说支持 100 多种语言的实时语音翻译,官方承诺终身免费。声音仅在本地处理,不上传、不记录,也不用于模型训练。目前 Mac 与 Windows 桌面端已上线,移动端仍在开发中。
该模型平均延迟为 200 至 600 毫秒,在多个基准测试中延迟与识别质量均达到开源模型 SOTA 水平,与闭源模型相比也不逊色。其训练采用了稳定前缀数据、强制时间对齐和词元级音频分割等策略。
Hi Echo 升级为 Agent 口语私教,采用端到端全双工语音对话,支持随时打断,并能识别语气与情绪。系统会评估用户水平并生成动态学习计划,底层为有道自研的 Helix 目标驱动型自进化学习系统。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

谷歌 6 月发布了一系列重磅 AI 更新,从本地大模型 Gemma 4 12B 到集成计算机使用能力的 Gemini 3.5 Flash,再到 Android 17 和新款 Home 音箱,全面展示了 AI 从云端走向本地、从被动响应走向主动执行的发展趋势。

中美建立AI对话机制与三大运营商叫停0元购机,看似无关的两件事共同指向技术治理逻辑的转变。本文从算力投资回报、智能体失控、数据隐私执法等维度,解析全球科技产业正在经历的制度重构。

Meta 在 Connect 大会上更新多条智能眼镜产品线,推出无摄像头的纯音频型号与超轻 VR 眼镜,以「做减法」和「时尚化」双线策略,重新思考智能眼镜的产品定义与市场边界。
獲取最新的 SEO 與 GEO 技術資訊。
我們尊重您的隱私,隨時可以取消訂閱。