字节 Seed SeedRealtime:音视频全双工大模型,把「何时开口」收进了模型内部

多数「实时语音」模型还是半双工:靠外部 VAD 判断轮次,一问一答。字节 Seed 这一版把「什么时候该说话」...

多数「实时语音」模型还是半双工:靠外部 VAD 判断轮次,一问一答。字节 Seed 这一版把「什么时候该说话」塞进了模型自己脑子里。

8 月 5 日 字节 Seed 发布 SeedRealtime,原生音视频全双工大模型。它把音频、视频、文本融进单一架构,在连续多模态信息流上实时交互,主打「边看、边听、边说」。技术路线是端到端统一建模,不是级联——官方点名 ASR+VLM+TTS 串联的延迟累积和信息损失,也点名多数端到端模型仍依赖外部 VAD,本质是半双工。SeedRealtime 把轮次判断内化为模型自身的多模态决策,因此原生支持实时打断和接话。它是流式的:连续音视频分块输入 + 流式生成输出,靠量化与推理优化提效。

已经全量上线豆包 App(对话框「打电话」→视频通话入口),官方自称「业界率先实现音视频全双工技术的规模化落地」。前序参照是 4 月 9 日的 Seeduplex(全双工语音,流畅度 +12%,同样上豆包),SeedRealtime 是它从纯语音扩到音视频的下一步。

官方只有一项量化指标:端到端人工评测,相比级联模型,对话节奏问题减少一半;抢话、迟滞、误触发显著减少。无延迟毫秒数、无参数量、无公开基准分。配了 7 段真实场景 demo:四人聚餐认人辨声、川菜馆英文点菜、河北博物馆导览主动提醒、咖啡机操作实时纠错、ResNet 论文陪读定位到 3.4 节、大兴机场抗噪不误触发、儿童英语陪练。

持续视觉流理解 + 主动提醒 + 时机判断 + 工具调用,恰好是具身智能体「交互层」的必备件。官方展望「从能对话到能行动」,与 Seed 已有的 GR-RL VLA 机器人线在能力栈上互补——但这次发布完全没有把两条线打通或关联,以下是我方推断而非官方主张。

无技术报告、无 arXiv、无开源权重、无 API(火山引擎未见接入公告),第三方无法复现或独立评测。「减少一半」出自厂商自建人工评测,未披露评测集规模和对照配置。网传「流畅度提升 37%」「机场识别 92%」「毫秒级延迟」等数字在官方页面查无出处,内容农场稿和「AI 生成」稿件均不可信,切勿采用。最关键:官方全文未提机器人、具身智能或本体部署,当前形态只是手机 App 内视频通话,不能写成「具身机器人已落地」。

来源: – 官方中文项目页 https://seed.bytedance.com/zh/SeedRealtime – 官方英文博客 https://seed.bytedance.com/en/blog/seedrealtime-audio-visual-full-duplex-llm-released-toward-omni-modal-natural-interaction – 官方英文项目页 https://seed.bytedance.com/en/SeedRealtime

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1