来源:互联网 更新时间:2026-08-08 09:04
8月5日,字节跳动正式放出了一个大招:原生音视频全双工大模型SeedRealtime,并同步宣布该模型已在豆包App全量上线。作为走向全模态交互的关键一步,SeedRealtime的特别之处在于——它用统一架构原生融合了音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。用户将豆包更新至最新版本后,通过“打电话”功能进入视频通话界面即可体验。

字节跳动
要知道,音视频实时交互的进化路径,其实一直卡在两种形态之间。级联系统依赖ASR、VLM、TTS等多个模块串联,延迟层层叠加,信息逐级损耗;端到端模型虽然更流畅,但不少方案仍依赖外置VAD判断轮次,本质上还是接近一问一答的半双工交互。SeedRealtime的核心突破,在于把声音、画面、时序与表达统一到同一个端到端模型中——它不是先听完、再看完、最后作答,而是在连续音视频流上,让感知、理解、决策与表达同步进行。具体来说,SeedRealtime实现了三项核心能力:

在官方展示的多个案例中,SeedRealtime的表现确实让人印象深刻。在多人聚会场景中,模型能够识别不同人物身份并持续对应发言者;帮助外国游客实时理解中文菜单和服务员介绍;在博物馆中持续观察镜头画面,识别指定文物后主动提醒;辅助用户操作咖啡机并根据画面变化实时纠错;阅读论文时持续监测翻页过程,在指定章节出现后自动提示。
在复杂环境下,SeedRealtime还能根据多模态信息判断何时回应、何时保持沉默。官方演示显示,在机场等嘈杂场景中,模型能够区分用户与旁人对话,避免因背景噪声或无关聊天误触发回应;在儿童学习场景中,也能够持续跟随用户互动,不受背景电话等声音干扰。
端到端人工评测结果也给出了硬指标。相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少了约50%。模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;同时,单次对话能够完整、顺畅交流的概率也有明显提升。
字节表示,未来还会继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力。目标很明确——推动AI从传统问答交互,进一步发展到能够在真实场景中持续理解环境并协助完成实际任务。SeedRealtime已在豆包App全量上线,在业界率先实现了音视频全双工技术的规模化落地。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币 2025 年价格预测:BTC 的未来走势
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
5000元起的鼠标哪个最值得入手?
男生高性价比充电头?
博世壁挂炉关闭暖气怎么操作
腾讯ima知识库怎么分类管理?
车载冰箱重置到出厂设置几步?
Windy卫星云图怎么看?云层变化识别技巧
5000-6000元鼠标有什么推荐?
管线机怎么接云米净水器
笔记本移动电源推荐哪款?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc