央廣網(wǎng)上海7月30日消息(記者何智康 實習(xí)記者吳嘉源)近日,具身全模態(tài)理解榜單 DailyOmni 公布了最新評測結(jié)果,一款中國自研的具身原生全模態(tài)大模型 WITA-Omni Preview 以85.21分的綜合成績登頂榜首,超過國內(nèi)外多款領(lǐng)先模型,并在八項細(xì)分指標(biāo)中的六項取得第一。

DailyOmni公布的最新評測結(jié)果(央廣網(wǎng)發(fā))
讓機(jī)器人交互更自然,讓“看、聽、說、動”渾然一體
據(jù)智元相關(guān)工作人員介紹,以往人形機(jī)器人進(jìn)行交互時,全模態(tài)模型大多優(yōu)先適配線上數(shù)字內(nèi)容交互,而機(jī)器人身處持續(xù)變化的物理空間,不僅需要同步“看見畫面、聽見聲音”,更要實時判斷聲音歸屬主體、事件發(fā)生順序,識別交互對象、找準(zhǔn)響應(yīng)時機(jī),傳統(tǒng)模塊化機(jī)器人方案很難完成這類時序耦合的復(fù)雜推理任務(wù),這也是長久以來人機(jī)交互生硬割裂的關(guān)鍵瓶頸。
WITA-Omni 作為具身智能行業(yè)內(nèi)首個機(jī)器人原生端到端多模態(tài)交互大模型,它并不是簡單地把聊天模型“裝進(jìn)”機(jī)器人,而是將物理動作和表情提升為與語音并列的一級輸出,用一個原生端到端模型統(tǒng)一驅(qū)動感知、決策與表達(dá)!袄斫狻焙汀盎貞(yīng)”將不再是兩個割裂的步驟,而是一個持續(xù)發(fā)生的物理過程。
看與聽不再割裂,語言與動作不再分離,理解與回應(yīng)不再是兩個獨(dú)立步驟,“看、聽、說、動”成為一個連續(xù)過程,打通了視覺、聽覺、語言、表情、肢體動作全模態(tài)協(xié)同,機(jī)器人不再只是 “會說話的工具”,而逐漸進(jìn)化為擁有在場感、人格感的硅基伙伴。
大規(guī)模數(shù)據(jù)訓(xùn)練、針對性訓(xùn)練策略,造就全球領(lǐng)先地位
據(jù)了解,WITA-Omni 的領(lǐng)先并非單純依靠模型規(guī)模,而是來自一套圍繞具身全模態(tài)交互構(gòu)建的分層數(shù)據(jù)體系與針對性訓(xùn)練方法。在中訓(xùn)練階段,WITA-Omni 使用千萬小時級多模態(tài)數(shù)據(jù),將強(qiáng)文本、視覺底座進(jìn)一步升級為能夠“聽得見、看得懂,并進(jìn)行音畫聯(lián)合推理”的全模態(tài)模型。
此外,由于公開音視頻數(shù)據(jù)通常缺少真實交互中的輪次切換、響應(yīng)時機(jī)、動作和表情信息,難以直接訓(xùn)練端到端具身交互模型。為此,智元構(gòu)建了以人為中心、面向真實交互場景的大規(guī)模高質(zhì)量全模態(tài)數(shù)據(jù)集,完整保留聲音、畫面、語言、動作和表情之間天然的時序關(guān)系。
在千小時級高質(zhì)量數(shù)據(jù)上,WITA-Omni 進(jìn)一步采用 SFT–OPD–RL 三階段訓(xùn)練策略,讓模型不僅學(xué)會“回答正確”,還必須進(jìn)一步判斷:是否應(yīng)該回應(yīng)、什么時候回應(yīng),以及正在與誰交互。
這項能力,正是具身智能落地現(xiàn)實場景,創(chuàng)造生產(chǎn)力的關(guān)鍵所在。
長按二維碼關(guān)注精彩內(nèi)容





