数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 57|回复: 0

[业界] 字节跳动发布SeedRealtime音视频全双工大模型,可实现边看边听边说实时交互

[复制链接]
发表于 6 小时前 | 显示全部楼层 |阅读模式

爱科技、爱创意、爱折腾、爱极致,我们都是技术控

您需要 登录 才可以下载或查看,没有账号?立即注册

x
凤凰网科技讯(作者/于雷)8月5日,字节跳动正式发布原生音视频全双工大模型SeedRealtime,并宣布该模型已在豆包App全量上线。用户将豆包更新至最新版本后,可通过“打电话”功能进入视频通话界面,体验实时音视频AI交互。
SeedRealtime采用统一端到端架构,原生融合音频、视频和文本,支持模型在连续多模态信息流中同步完成感知、理解、决策与表达,实现“边看、边听、边说”的实时交互。与传统依赖ASR、视觉模型、TTS等多个模块串联的级联系统相比,该模型减少了多模块带来的延迟和信息损耗,也不再依赖外部VAD进行轮次判断。
字节表示,SeedRealtime实现了三项核心能力,包括音视频联合理解、主动交互能力以及更自然的对话节奏。模型能够结合画面、声音和时序信息理解用户意图,例如利用视觉信息消除同音词歧义、识别手势和指代对象,并持续跟踪画面变化,在目标出现时主动提醒用户。
在官方展示的多个应用案例中,模型能够在多人聚会中识别不同人物身份并持续对应发言者;帮助外国游客实时理解中文菜单和服务员介绍;在博物馆持续观察镜头画面,识别指定文物后主动提醒;辅助用户操作咖啡机并根据画面变化实时纠错;阅读论文时持续监测翻页过程,在指定章节出现后自动提示。
在复杂环境下,SeedRealtime还能根据多模态信息判断何时回应、何时保持沉默。官方演示显示,在机场等嘈杂场景中,模型能够区分用户与旁人对话,避免因背景噪声或无关聊天误触发回应;在儿童学习场景中,也能够持续跟随用户互动,不受背景电话等声音干扰。
                        

字节披露的

字节表示,未来将继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力,推动AI从传统问答交互进一步发展到能够在真实场景中持续理解环境并协助完成实际任务。





您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-8-5 22:59 , Processed in 0.078000 second(s), 9 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表