字节跳动发布SeedRealtime:统一架构原生音视频全双工,豆包已全量上线

8月5日,字节跳动正式发布SeedRealtime,这是一款原生音视频全双工大模型,采用统一端到端架构,原生融合音频、视频与文本三种模态信号,能在连续的多模态信息流上实时交互,带来"边看、边听、边说"的全新体验。8月5日当天,该模型已在豆包App全量上线,用户将豆包更新至最新版本后即可通过"打电话"功能进入视频通话界面,体验实时音视频AI交互。

豆包视频通话

SeedRealtime的核心创新在于打破传统级联系统的局限。此前,业界主流方案依赖自动语音识别(ASR)、视觉模型、语音合成(TTS)等多个模块串联,感知、理解、表达分属不同环节,延迟层层叠加。SeedRealtime则将声音、画面、时序与表达统一到同一个端到端模型中,不再依赖外部语音活动检测(VAD)进行轮次判断,在连续的多模态信息流上同步完成感知、理解、决策与表达。

一、三大核心能力:从被动应答到主动感知

SeedRealtime实现了三项核心能力。第一项是音视频联合理解:模型能够原生融合声音、画面与时序信息,结合场景消解同音词歧义,也能准确理解视觉中的时序指代。例如,用户说"这个怎么弄"时,模型需要结合当前画面、手势与历史动作判断"这个"具体指向什么。

第二项是主动交互能力:模型具备持续的环境感知与主动表达能力,能在察觉画面状态变化时主动提醒,并能调用工具融入表达。官方演示中,模型可在博物馆持续观察镜头画面、识别指定文物后主动提醒,也可在用户操作咖啡机时根据画面变化实时纠错。

第三项是更流畅的交互节奏:模型能够实时感知用户的对话状态,在适当时机自然接话、停顿与回应;同时具备抗干扰能力,能分辨旁人闲聊与背景噪声,避免误触发。

二、性能对比:节奏问题减少约50%

在用户体验层面,端到端人工评测结果显示,相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少约50%,包括抢话、回应延迟以及背景噪声误触发等情况均明显下降,同时单次对话能够完整、流畅进行的概率也有所提升。在嘈杂场景中,模型能够区分用户与旁人对话,避免因背景噪声或无关聊天误触发回应。

多项应用案例已得到官方演示验证:在多人聚会中识别不同发言者并追踪指定目标、帮助外国游客实时理解中文菜单、在博物馆识别并提醒指定文物、辅助操作咖啡机实时纠错,以及阅读论文时监测翻页并提示指定章节。

三、未来方向:从问答交互到任务协作

字节跳动表示,未来将继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力,推动AI从传统问答交互进一步发展到能够在真实场景中持续理解环境并协助完成实际任务。这意味着SeedRealtime不仅是一个对话工具,更将成为日常生活和工作中的主动助手。

AD:精心整理了2000+好用的AI工具!点此获取

相关推荐

1 1

免费AI工具合集,点击进入

AI对话

玉米AI助手