05/08/2026 13:51
【AI】字節跳動發布SeedRealtime音視頻全雙工大模型,已上線豆包
字節跳動今日正式發布原生音視頻全雙工大模型SeedRealtime,並宣布該模型已在豆包App全量上線。用戶將豆包更新至最新版本後,可通過「打電話」功能進入視頻通話界面,體驗實時音視頻AI交互。
SeedRealtime採用統一端到端架構,原生融合音頻、視頻和文本,支持模型在連續多模態信息流中同步完成感知、理解、決策與表達,實現「邊看、邊聽、邊說」的實時交互。與傳統依賴ASR、視覺模型、TTS等多個模塊串聯的級聯系統相比,該模型減少了多模塊帶來的延遲和信息損耗,也不再依賴外部VAD進行輪次判斷。
字節表示,SeedRealtime實現了三項核心能力,包括音視頻聯合理解、主動交互能力以及更自然的對話節奏。模型能夠結合畫面、聲音和時序信息理解用戶意圖,例如利用視覺信息消除同音詞歧義、識別手勢和指代對象,並持續跟蹤畫面變化,在目標出現時主動提醒用戶。
《經濟通通訊社5日專訊》
SeedRealtime採用統一端到端架構,原生融合音頻、視頻和文本,支持模型在連續多模態信息流中同步完成感知、理解、決策與表達,實現「邊看、邊聽、邊說」的實時交互。與傳統依賴ASR、視覺模型、TTS等多個模塊串聯的級聯系統相比,該模型減少了多模塊帶來的延遲和信息損耗,也不再依賴外部VAD進行輪次判斷。
字節表示,SeedRealtime實現了三項核心能力,包括音視頻聯合理解、主動交互能力以及更自然的對話節奏。模型能夠結合畫面、聲音和時序信息理解用戶意圖,例如利用視覺信息消除同音詞歧義、識別手勢和指代對象,並持續跟蹤畫面變化,在目標出現時主動提醒用戶。
《經濟通通訊社5日專訊》
【你點睇?】新皇崗口岸最快9月啟用,新增多條巴士路線直達,你會否於新口岸啟用後嘗鮮使用? ► 立即投票
-
上一篇
【AI】越疆發布新一代具身全棲人形機器人DOBOT LUMO 05/08/2026 14:02
-
下一篇
【AI】月之暗面據報啟動Pre-IPO融資,估值達500億美元 05/08/2026 10:43
-
【AI】影石AI硬件據報接入千問大模型,率先落地Go Ultra系列口袋相機 05/08/2026 14:48
-
【AI】DeepSeek據報重啟第二輪融資,擬籌500億元 05/08/2026 09:39
-
【AI】長鑫科技內存芯片傳有重大突破,將縮小與SK海力士等差距 05/08/2026 08:58