GEO资讯

字节SeedRealtime上线,AI开始“边看边听边说”

发布于 2026/8/7 57 次阅读
字节SeedRealtime上线,AI开始“边看边听边说”

字节SeedRealtime上线,AI开始"边看边听边说"

8月5日,字节跳动Seed团队发布原生音视频全双工大模型SeedRealtime,并在豆包App全量上线。所谓"全双工",指的不是轮流发言,而是AI能在连续的信息流里同时完成感知、理解、决策和表达——看着画面、听着声音、随时开口,像真人对话一样。

和过去的AI视频通话有什么不同

过去的AI视频通话是一串模块接力:先用语音识别把声音转成文字,再交给视觉模型看画面,文本模型想清楚后,最后由语音合成念出来。链路一长,延迟层层叠加,声音、画面、文字之间的细节也在一次次转换中损耗。SeedRealtime不再拆开这些步骤,而是用统一架构把声音、画面、时序和表达压进同一个端到端模型,也不再依赖外部语音活动检测来判断"该谁说话"。

字节披露的端到端人工评测显示,相比级联系统,SeedRealtime把音视频对话里的节奏问题减少了大约一半——抢话、回应迟滞、被背景杂音误触发这些卡壳现象明显下降,单次对话完整顺畅进行的概率也更高。

三个核心能力对应三个场景

第一是音视频联合理解。模型把声音、画面和时间线深度融合,你指着屏幕说"这个怎么弄",它能结合画面和手势判断"这个"指什么;遇到"bank"这类同音词,它靠画面区分是银行还是河岸。第二是主动交互。模型持续观察环境,状态变化时会主动开口——官方演示里,它在博物馆盯着展品,认出指定文物后主动讲解;你操作咖啡机时,它根据画面变化实时纠错。第三是流畅节奏。在机场等嘈杂环境,它能分辨你是在和旁人闲聊还是在对它说话,不因无关声音误触发,也不会一直沉默。

这些能力对应的应用场景已经相当具体:多人聚会中识别不同人物并对应发言者、帮外国游客实时理解中文菜单、陪孩子学习时不受背景电话干扰。豆包把这套能力铺到全量用户上,是业界首次把音视频全双工技术做到这个量级——截至2026年6月,豆包月活跃用户3.82亿。

四个月,从"只听只说"到"边看边说"

这次发布是字节在实时交互上的连续动作。今年4月9日,字节先发布了语音全双工模型Seeduplex,同样在豆包全量上线。当时的A/B实验显示,用户通话满意度绝对值提升8.34%,误打断率减半,抢话比例下降40%。从Seeduplex到SeedRealtime只隔了四个月,交互从"只听只说"走到了"边看边听边说"。字节表示,后续还将继续优化端到端时延、主动感知与决策能力、多人复杂场景理解以及工具调用能力——言下之意,实时多模态交互还在快速迭代期,眼下看到的只是起点。

对品牌内容意味着什么

从4月的语音全双工模型Seeduplex,到8月的SeedRealtime,字节只用了四个月。这条产品线的节奏说明:AI交互正从"你问我答"走向"它也在盯着看"。对企业来说,两个变化值得提前准备。一是用户的触点会从文字问答扩展到视频通话、实时互动,品牌信息能不能在"被看到"的场景里被准确表达,成为新的课题;二是多模态内容(产品视频、操作演示、图文规范)的价值在上升——AI要理解并引用一个品牌,依赖的正是这些结构化、可核验的素材。

本文事实来自字节跳动Seed官方信息及上海证券报、凤凰网科技、每日经济新闻等媒体的报道,豆包用户数据引用QuestMobile与火山引擎披露口径。

信息来源

  • 上海证券报·中国证券网:《字节跳动发布音视频全双工大模型SeedRealtime》,2026年8月5日,cnstock.com
  • 凤凰网科技:《字节跳动发布SeedRealtime音视频全双工大模型,可实现边看边听边说实时交互》,2026年8月5日,163.com
  • 腾讯新闻:《字节SeedRealtime上线:AI首次真正"边看边听边说"》,2026年8月6日,new.qq.com