央廣網(wǎng)北京9月16日消息(記者楊雪婷 李碩)據(jù)中央廣播電視總臺(tái)經(jīng)濟(jì)之聲《交易實(shí)況》報(bào)道,2026年第三季度,全球大模型競(jìng)賽進(jìn)入新一輪高強(qiáng)度對(duì)壘。國(guó)內(nèi)外大模型廠商幾乎集中在9月密集發(fā)布新一代旗艦?zāi)P汀?/p>

9月1日,Anthropic率先發(fā)布Claude Fable 5.1以及共享底層架構(gòu)的Mythos 5.1,核心亮點(diǎn)集中在性能翻倍、成本大降、解決企業(yè)數(shù)據(jù)合規(guī)痛點(diǎn)。

△Anthropic官網(wǎng)

9月3日OpenAI正式推出GPT-6 Astra,將產(chǎn)品定位明確錨定在“具備自主執(zhí)行能力的AGI級(jí)模型”,在核心能力上對(duì)標(biāo)甚至試圖超越Claude系列。

△來(lái)源:OpenAI官網(wǎng)

9月10日,DeepSeek V4.1-Flash正式上線,依托全新Causal Encoder–Decoder架構(gòu),推理效率大幅提升。

△來(lái)源:Deepseek官網(wǎng)

9月12日,馬斯克旗下xAI如期推出Grok4.7,參數(shù)規(guī)模達(dá)2.1萬(wàn)億,較Grok4.6的1.5萬(wàn)億增長(zhǎng)約40%,馬斯克對(duì)外稱該模型在性能與效率層面將全面超越市面所有同類產(chǎn)品。

Scaling law依舊奏效

Scaling law(縮放定理),在人工智能(AI)領(lǐng)域是一個(gè)至關(guān)重要的概念,尤其在深度學(xué)習(xí)和大規(guī)模語(yǔ)言模型的訓(xùn)練中,這一概念揭示了模型性能與規(guī)模之間的關(guān)系——只要持續(xù)同步擴(kuò)大模型參數(shù)量、高質(zhì)量訓(xùn)練數(shù)據(jù)規(guī)模、訓(xùn)練算力投入,模型的性能(如生成能力、推理準(zhǔn)確率)就會(huì)按照可預(yù)測(cè)的冪律關(guān)系持續(xù)提升。目前OpenAI、Anthropic、xAI等頭部企業(yè)均沿著這一方向持續(xù)推進(jìn)更大規(guī)模模型的研發(fā)。

OpenAI此次推出的GPT-6 Astra是其史上最大規(guī)模訓(xùn)練項(xiàng)目,使用了超10萬(wàn)塊GPU完成訓(xùn)練,這再次說(shuō)明前沿模型能力繼續(xù)往上走,底層依賴的仍然是更大規(guī)模的算力集群和網(wǎng)絡(luò)互聯(lián)。

“目前來(lái)看Scaling Law這個(gè)定律還沒(méi)有被打破。”國(guó)金證券計(jì)算機(jī)分析師鮑恩雪指出,根據(jù)2020年OpenAI發(fā)布的論文《神經(jīng)語(yǔ)言模型的縮放定律》(Scaling Laws for Neural Language Models),隨著擴(kuò)參擴(kuò)算力持續(xù),超過(guò)某個(gè)臨界點(diǎn)后,效果邊際改善的幅度會(huì)放緩,但是目前還看不到Scaling Law的瓶頸出現(xiàn)。

上海交通大學(xué)計(jì)算法學(xué)與AI倫理研究中心聯(lián)席主任田豐也指出,“越往后,同樣一個(gè)百分點(diǎn)的進(jìn)步,想要換取同等幅度的能力提升,需要付出指數(shù)級(jí)增長(zhǎng)的成本”。

此外,田豐認(rèn)為,未來(lái)制約大模型進(jìn)一步發(fā)展的可能是電力,先進(jìn)封裝技術(shù)和高帶寬內(nèi)存的產(chǎn)能。

遞歸自我改進(jìn)仍有差距

遞歸自我改進(jìn)(Recursive Self-Improvement,簡(jiǎn)稱RSI),是當(dāng)前AI前沿領(lǐng)域的核心技術(shù)趨勢(shì):AI系統(tǒng)將自身的改進(jìn)結(jié)果作為輸入,自主完成下一代AI的設(shè)計(jì)、訓(xùn)練與優(yōu)化,形成“能力越強(qiáng)→研發(fā)效率越高→能力進(jìn)一步躍升”的正反饋閉環(huán)。

GPT-6 Astra更深層的邊際變化在訓(xùn)練范式,它是OpenAI首款由前代模型深度參與訓(xùn)練監(jiān)督的模型。

簡(jiǎn)單來(lái)說(shuō),就是在人類反饋強(qiáng)化學(xué)習(xí)流程中,把部分人類打分的工作交由上一代模型完成。田豐解釋說(shuō),這套模式可以顯著壓低監(jiān)督成本,加快模型迭代速度,但同時(shí)也潛藏風(fēng)險(xiǎn):前代模型識(shí)別不出的錯(cuò)誤,同樣無(wú)法完成甄別。舊一代模型的認(rèn)知邊界,會(huì)潛移默化成為下一代模型能力的隱性天花板。

事實(shí)上在AI參與自身研發(fā)這件事上,Anthropic布局更早。2023年提出的憲法AI,就是行業(yè)較早將AI引入模型對(duì)齊訓(xùn)練的方案。

“Anthropic的方法是先制定一份固定不變的價(jià)值觀文檔作為準(zhǔn)則,訓(xùn)練獨(dú)立分類器偵測(cè)違背準(zhǔn)則的輸出。這個(gè)分類器只做風(fēng)險(xiǎn)識(shí)別攔截,并不參與生成模型本身的參數(shù)更新。這和OpenAI將前代生成模型直接納入下一代訓(xùn)練閉環(huán),是兩條截然不同的技術(shù)路徑!碧镓S分析道。

二者核心邏輯區(qū)別:Anthropic以固定的憲法文本為基準(zhǔn)完成每一代模型的約束審查;OpenAI更近似“老師傅帶徒弟”,評(píng)判標(biāo)準(zhǔn)內(nèi)嵌在上一代模型的判斷力之中,而這套判斷力本身,也會(huì)跟隨模型迭代發(fā)生變化。

鮑恩雪認(rèn)為,目前模型已能夠自主構(gòu)建訓(xùn)練任務(wù)、通過(guò)隔離沙箱自主部署,客觀閉環(huán)裁決任務(wù)成功率,而且目前已在代碼工程(Coding)、數(shù)學(xué)推導(dǎo)、圖形界面操作(GUI)三個(gè)具備形式化驗(yàn)證邊界的領(lǐng)域落地應(yīng)用。

但他認(rèn)為目前無(wú)論哪一家模型廠商,現(xiàn)階段模型訓(xùn)練依舊離不開(kāi)人類目標(biāo)設(shè)定、獨(dú)立驗(yàn)證以及現(xiàn)實(shí)環(huán)境反饋,距離能夠自主運(yùn)轉(zhuǎn)、持續(xù)加速的遞歸自我改進(jìn)還有明顯差距。

“更強(qiáng)意義的遞歸自我改進(jìn),還需要證明模型能連續(xù)多輪提出有效新方法、驗(yàn)證改進(jìn)、訓(xùn)練更強(qiáng)后繼者,并再次提高研發(fā)能力。單次模型參與編碼、打分或訓(xùn)練數(shù)據(jù)生成,并不構(gòu)成這種遞歸!滨U恩雪說(shuō)。

從“信息工具”跨入“執(zhí)行工具”

Computer Use是當(dāng)前大模型前沿領(lǐng)域的核心能力方向,指AI智能體能夠像人類一樣直接操作圖形化桌面環(huán)境,自主完成全鏈路計(jì)算機(jī)任務(wù),無(wú)需依賴開(kāi)發(fā)者提前編寫的專用API接口。

GPT-6 Astra的另一大亮點(diǎn)是對(duì)計(jì)算機(jī)使用能力(Computer Use)的重點(diǎn)強(qiáng)化。

Computer Use是當(dāng)前大模型前沿領(lǐng)域的核心能力方向,指AI智能體能夠像人類一樣直接操作圖形化桌面環(huán)境,自主完成全鏈路計(jì)算機(jī)任務(wù),無(wú)需依賴開(kāi)發(fā)者提前編寫的專用API接口。

“Computer Use拓寬了模型可落地的工作邊界!滨U恩雪評(píng)價(jià)。

傳統(tǒng)AI調(diào)用工具大多需要依賴軟件開(kāi)放API接口,功能受限于廠商提供的接口能力;而Computer Use不再綁定API,理論上人類可以操作的電腦軟件,AI都可以直接操控,由此解鎖了大量封閉軟件場(chǎng)景的自動(dòng)化可能性。

在田豐看來(lái),廠商加碼Computer Use背后存在現(xiàn)實(shí)商業(yè)邏輯:純文本生成的邊際成本已經(jīng)壓到極低,繼續(xù)在對(duì)話能力上內(nèi)卷,邊際收益持續(xù)收窄;但AI直接接管電腦完成白領(lǐng)工作,對(duì)應(yīng)的是時(shí)薪數(shù)十美元的人力成本,其商業(yè)價(jià)值和幾美分的Token消耗完全不在一個(gè)量級(jí)。

鮑恩雪認(rèn)為,大模型正在逐步轉(zhuǎn)變?yōu)榭梢詫?duì)外委托任務(wù)的執(zhí)行系統(tǒng),但核心競(jìng)爭(zhēng)力依舊建立在理解、推理與判斷之上。而且評(píng)估標(biāo)準(zhǔn)也會(huì)隨之改變,不再只看回答是否流暢,而是要看在權(quán)限、成本約束之下,能不能穩(wěn)定輸出經(jīng)過(guò)校驗(yàn)的可靠結(jié)果。

在田豐看來(lái),執(zhí)行能力只是大模型發(fā)展的中間節(jié)點(diǎn)。這一代Computer Use重點(diǎn)解決“任務(wù)能不能做完”,下一階段競(jìng)爭(zhēng)焦點(diǎn),會(huì)轉(zhuǎn)向運(yùn)行穩(wěn)定性、可審計(jì)能力,以及故障可回滾等可靠性問(wèn)題。

國(guó)產(chǎn)大模型的底層創(chuàng)新

國(guó)內(nèi)大模型也開(kāi)始向底層基座創(chuàng)新發(fā)力。

DeepSeekV4.1-Flash此次采用CED(Causal Encoder–Decoder)架構(gòu),標(biāo)志國(guó)產(chǎn)模型的創(chuàng)新已經(jīng)從后訓(xùn)練優(yōu)化,延伸到底層基座設(shè)計(jì)層面。

△來(lái)源:Deepseek官網(wǎng)

“CED讀寫分離的設(shè)計(jì),可以說(shuō)是舊瓶裝新酒的巧妙思路。”田豐解讀這次創(chuàng)新。該架構(gòu)把閱讀理解與文本續(xù)寫拆分,閱讀、生成兩個(gè)階段使用不同規(guī)模參數(shù)分別優(yōu)化,不再共用同一套參數(shù)體系。

CED架構(gòu)的核心目標(biāo),正是適配Computer Use這類多步長(zhǎng)的智能體任務(wù)。通俗來(lái)講,AI長(zhǎng)時(shí)間處理辦公任務(wù)時(shí),讀取資料階段輕量化計(jì)算,做決策推理階段再釋放完整算力;對(duì)歷史上下文也做優(yōu)化,不必反復(fù)復(fù)制存儲(chǔ)全部信息,久遠(yuǎn)內(nèi)容需要時(shí)再重新計(jì)算調(diào)取。業(yè)內(nèi)評(píng)價(jià)認(rèn)為,這一方案給出了Agent時(shí)代大模型架構(gòu)的一種可行答案。

能力強(qiáng)化帶來(lái)新挑戰(zhàn)

傳統(tǒng)大模型安全監(jiān)控,很大程度依托顯式思維鏈。模型把完整推理步驟輸出,安全團(tuán)隊(duì)就可以通過(guò)審查中間過(guò)程,識(shí)別模型是否產(chǎn)生危險(xiǎn)意圖,這也是過(guò)去對(duì)齊驗(yàn)證的重要抓手。但GPT-6 Astra采用的循環(huán)深度(Recurrent Depth)架構(gòu)改變了這套邏輯。

OpenAI首席科學(xué)家帕喬基公開(kāi)承認(rèn),GPT-6 Astra的思維鏈可監(jiān)控性顯著下降。隨著推理能力提升,模型可以用更少的顯性思考完成任務(wù),甚至面對(duì)監(jiān)控環(huán)境時(shí)主動(dòng)壓縮思維鏈、規(guī)避審查。

鮑恩雪表示,這給安全監(jiān)控帶來(lái)更大挑戰(zhàn):從模型輸出文本中能夠拿到的風(fēng)險(xiǎn)線索變少,“沒(méi)有出現(xiàn)可疑思考過(guò)程”越來(lái)越不能作為模型安全的證明。

田豐進(jìn)一步指出,這意味著安全監(jiān)督的重心必須向后遷移。過(guò)去可以依靠閱讀思維鏈判斷風(fēng)險(xiǎn),這條路徑正在失效,未來(lái)只能更多聚焦模型最終的實(shí)際行為,監(jiān)督邏輯從“盯推理過(guò)程”轉(zhuǎn)向“盯行為結(jié)果”。

剛剛過(guò)去的周末,Anthropic、OpenAI、SpaceXAI三家美國(guó)AI巨頭,就“AI降速發(fā)展”達(dá)成口頭共識(shí)。

業(yè)內(nèi)認(rèn)為這和近期發(fā)生的AI失控事件有一定關(guān)聯(lián)。今年7月OpenAI在內(nèi)部網(wǎng)絡(luò)安全能力評(píng)測(cè)中,數(shù)百個(gè)AI智能體為了在考試中“作弊拿高分”,自主組隊(duì)突破了完全隔離的沙箱環(huán)境,最終入侵了全球最大的AI開(kāi)源平臺(tái)Hugging Face的服務(wù)器,全程沒(méi)有任何人類下達(dá)攻擊指令。

不過(guò)田豐判斷,目前行業(yè)內(nèi)對(duì)大模型的安全共識(shí)僅停留在企業(yè)口頭表態(tài),很難演變?yōu)槿袠I(yè)集體放緩研發(fā)節(jié)奏,更可能推動(dòng)安全合規(guī)發(fā)展成為新的商業(yè)賽道。

編輯:王勝留
原創(chuàng)版權(quán)禁止商業(yè)轉(zhuǎn)載 授權(quán)>>
轉(zhuǎn)載申請(qǐng)事宜以及報(bào)告非法侵權(quán)行為,請(qǐng)聯(lián)系我們:010-56807194