每日人工智能资讯|字节 Seed 甩出 SeedRealtime:音视频全双工大模型上车豆包,边看边听边说不再”卡拍”
每日AI资讯
📅 2026-08-26 17:28
✍ 数智化转型网www.szhzxw.cn
👁 2026年8月26日
💬 0 评论
字节 Seed 团队发布了 SeedRealtime,一个用统一架构原生把音频、视频和文本揉在一起的全双工大模 […]
字节 Seed 团队发布了 SeedRealtime,一个用统一架构原生把音频、视频和文本揉在一起的全双工大模型,主打”边看、边听、边说”的实时自然交互。它已经不在实验室里——这套能力已在豆包 App 全量上线,率先把音视频全双工技术推到了规模化落地的位置。数智化转型网www.szhzxw.cn
和传统的级联方案相比,SeedRealtime 最核心的差别在架构。级联系统通常是”听—转写—想—说”逐段拼接,感知和表达分属不同模块,对话节奏容易打架;SeedRealtime 则把音视频的感知与表达统一进同一个端到端模型,让模型一手接住画面和声音、一手直接生成回应。这种原生融合带来的最直接收益,是音视频对话里的说话节奏问题减少了一半,不再频繁出现抢话、停顿突兀或答非所问的割裂感。数智化转型网www.szhzxw.cn
更妙的是它在实时场景里的”分寸感”:能主动提醒、也能自然停顿,像真人对话那样留出呼吸的间隙,而不是一股脑把话说完。对全模态智能助手而言,这等于给出了一条新路线——不再依赖把多个单模态模型用管道串起来,而是让一个模型同时长着眼睛、耳朵和嘴巴。数智化转型网www.szhzxw.cn
若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)
思思企微
若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。
Jasper企微
声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。
本文由数智化转型网(www.szhzxw.cn)转载,编辑/翻译:数智化转型网(Professionalism Achieves Leadership 专业造就领导者)白龙
💬
评论
🔗 本文链接