央廣網(wǎng)北京9月16日消息(記者楊雪婷 李碩)據(jù)中央廣播電視總臺經(jīng)濟之聲《交易實況》報道,2026年第三季度,全球大模型競賽進入新一輪高強度對壘。國內(nèi)外大模型廠商幾乎集中在9月密集發(fā)布新一代旗艦?zāi)P汀?/p>
9月1日,Anthropic率先發(fā)布Claude Fable 5.1以及共享底層架構(gòu)的Mythos 5.1,核心亮點集中在性能翻倍、成本大降、解決企業(yè)數(shù)據(jù)合規(guī)痛點。

△Anthropic官網(wǎng)
9月3日OpenAI正式推出GPT-6 Astra,將產(chǎn)品定位明確錨定在“具備自主執(zhí)行能力的AGI級模型”,在核心能力上對標(biāo)甚至試圖超越Claude系列。

△來源:OpenAI官網(wǎng)
9月10日,DeepSeek V4.1-Flash正式上線,依托全新Causal Encoder–Decoder架構(gòu),推理效率大幅提升。

△來源:Deepseek官網(wǎng)
9月12日,馬斯克旗下xAI如期推出Grok4.7,參數(shù)規(guī)模達(dá)2.1萬億,較Grok4.6的1.5萬億增長約40%,馬斯克對外稱該模型在性能與效率層面將全面超越市面所有同類產(chǎn)品。
Scaling law依舊奏效
Scaling law(縮放定理),在人工智能(AI)領(lǐng)域是一個至關(guān)重要的概念,尤其在深度學(xué)習(xí)和大規(guī)模語言模型的訓(xùn)練中,這一概念揭示了模型性能與規(guī)模之間的關(guān)系——只要持續(xù)同步擴大模型參數(shù)量、高質(zhì)量訓(xùn)練數(shù)據(jù)規(guī)模、訓(xùn)練算力投入,模型的性能(如生成能力、推理準(zhǔn)確率)就會按照可預(yù)測的冪律關(guān)系持續(xù)提升。目前OpenAI、Anthropic、xAI等頭部企業(yè)均沿著這一方向持續(xù)推進更大規(guī)模模型的研發(fā)。
OpenAI此次推出的GPT-6 Astra是其史上最大規(guī)模訓(xùn)練項目,使用了超10萬塊GPU完成訓(xùn)練,這再次說明前沿模型能力繼續(xù)往上走,底層依賴的仍然是更大規(guī)模的算力集群和網(wǎng)絡(luò)互聯(lián)。
“目前來看Scaling Law這個定律還沒有被打破!眹鹱C券計算機分析師鮑恩雪指出,根據(jù)2020年OpenAI發(fā)布的論文《神經(jīng)語言模型的縮放定律》(Scaling Laws for Neural Language Models),隨著擴參擴算力持續(xù),超過某個臨界點后,效果邊際改善的幅度會放緩,但是目前還看不到Scaling Law的瓶頸出現(xiàn)。
上海交通大學(xué)計算法學(xué)與AI倫理研究中心聯(lián)席主任田豐也指出,“越往后,同樣一個百分點的進步,想要換取同等幅度的能力提升,需要付出指數(shù)級增長的成本”。
此外,田豐認(rèn)為,未來制約大模型進一步發(fā)展的可能是電力,先進封裝技術(shù)和高帶寬內(nèi)存的產(chǎn)能。
遞歸自我改進仍有差距
遞歸自我改進(Recursive Self-Improvement,簡稱RSI),是當(dāng)前AI前沿領(lǐng)域的核心技術(shù)趨勢:AI系統(tǒng)將自身的改進結(jié)果作為輸入,自主完成下一代AI的設(shè)計、訓(xùn)練與優(yōu)化,形成“能力越強→研發(fā)效率越高→能力進一步躍升”的正反饋閉環(huán)。
GPT-6 Astra更深層的邊際變化在訓(xùn)練范式,它是OpenAI首款由前代模型深度參與訓(xùn)練監(jiān)督的模型。
簡單來說,就是在人類反饋強化學(xué)習(xí)流程中,把部分人類打分的工作交由上一代模型完成。田豐解釋說,這套模式可以顯著壓低監(jiān)督成本,加快模型迭代速度,但同時也潛藏風(fēng)險:前代模型識別不出的錯誤,同樣無法完成甄別。舊一代模型的認(rèn)知邊界,會潛移默化成為下一代模型能力的隱性天花板。
事實上在AI參與自身研發(fā)這件事上,Anthropic布局更早。2023年提出的憲法AI,就是行業(yè)較早將AI引入模型對齊訓(xùn)練的方案。
“Anthropic的方法是先制定一份固定不變的價值觀文檔作為準(zhǔn)則,訓(xùn)練獨立分類器偵測違背準(zhǔn)則的輸出。這個分類器只做風(fēng)險識別攔截,并不參與生成模型本身的參數(shù)更新。這和OpenAI將前代生成模型直接納入下一代訓(xùn)練閉環(huán),是兩條截然不同的技術(shù)路徑!碧镓S分析道。
二者核心邏輯區(qū)別:Anthropic以固定的憲法文本為基準(zhǔn)完成每一代模型的約束審查;OpenAI更近似“老師傅帶徒弟”,評判標(biāo)準(zhǔn)內(nèi)嵌在上一代模型的判斷力之中,而這套判斷力本身,也會跟隨模型迭代發(fā)生變化。
鮑恩雪認(rèn)為,目前模型已能夠自主構(gòu)建訓(xùn)練任務(wù)、通過隔離沙箱自主部署,客觀閉環(huán)裁決任務(wù)成功率,而且目前已在代碼工程(Coding)、數(shù)學(xué)推導(dǎo)、圖形界面操作(GUI)三個具備形式化驗證邊界的領(lǐng)域落地應(yīng)用。
但他認(rèn)為目前無論哪一家模型廠商,現(xiàn)階段模型訓(xùn)練依舊離不開人類目標(biāo)設(shè)定、獨立驗證以及現(xiàn)實環(huán)境反饋,距離能夠自主運轉(zhuǎn)、持續(xù)加速的遞歸自我改進還有明顯差距。
“更強意義的遞歸自我改進,還需要證明模型能連續(xù)多輪提出有效新方法、驗證改進、訓(xùn)練更強后繼者,并再次提高研發(fā)能力。單次模型參與編碼、打分或訓(xùn)練數(shù)據(jù)生成,并不構(gòu)成這種遞歸!滨U恩雪說。
從“信息工具”跨入“執(zhí)行工具”
Computer Use是當(dāng)前大模型前沿領(lǐng)域的核心能力方向,指AI智能體能夠像人類一樣直接操作圖形化桌面環(huán)境,自主完成全鏈路計算機任務(wù),無需依賴開發(fā)者提前編寫的專用API接口。
GPT-6 Astra的另一大亮點是對計算機使用能力(Computer Use)的重點強化。
Computer Use是當(dāng)前大模型前沿領(lǐng)域的核心能力方向,指AI智能體能夠像人類一樣直接操作圖形化桌面環(huán)境,自主完成全鏈路計算機任務(wù),無需依賴開發(fā)者提前編寫的專用API接口。
“Computer Use拓寬了模型可落地的工作邊界!滨U恩雪評價。
傳統(tǒng)AI調(diào)用工具大多需要依賴軟件開放API接口,功能受限于廠商提供的接口能力;而Computer Use不再綁定API,理論上人類可以操作的電腦軟件,AI都可以直接操控,由此解鎖了大量封閉軟件場景的自動化可能性。
在田豐看來,廠商加碼Computer Use背后存在現(xiàn)實商業(yè)邏輯:純文本生成的邊際成本已經(jīng)壓到極低,繼續(xù)在對話能力上內(nèi)卷,邊際收益持續(xù)收窄;但AI直接接管電腦完成白領(lǐng)工作,對應(yīng)的是時薪數(shù)十美元的人力成本,其商業(yè)價值和幾美分的Token消耗完全不在一個量級。
鮑恩雪認(rèn)為,大模型正在逐步轉(zhuǎn)變?yōu)榭梢詫ν馕腥蝿?wù)的執(zhí)行系統(tǒng),但核心競爭力依舊建立在理解、推理與判斷之上。而且評估標(biāo)準(zhǔn)也會隨之改變,不再只看回答是否流暢,而是要看在權(quán)限、成本約束之下,能不能穩(wěn)定輸出經(jīng)過校驗的可靠結(jié)果。
在田豐看來,執(zhí)行能力只是大模型發(fā)展的中間節(jié)點。這一代Computer Use重點解決“任務(wù)能不能做完”,下一階段競爭焦點,會轉(zhuǎn)向運行穩(wěn)定性、可審計能力,以及故障可回滾等可靠性問題。
國產(chǎn)大模型的底層創(chuàng)新
國內(nèi)大模型也開始向底層基座創(chuàng)新發(fā)力。
DeepSeekV4.1-Flash此次采用CED(Causal Encoder–Decoder)架構(gòu),標(biāo)志國產(chǎn)模型的創(chuàng)新已經(jīng)從后訓(xùn)練優(yōu)化,延伸到底層基座設(shè)計層面。

△來源:Deepseek官網(wǎng)
“CED讀寫分離的設(shè)計,可以說是舊瓶裝新酒的巧妙思路。”田豐解讀這次創(chuàng)新。該架構(gòu)把閱讀理解與文本續(xù)寫拆分,閱讀、生成兩個階段使用不同規(guī)模參數(shù)分別優(yōu)化,不再共用同一套參數(shù)體系。
CED架構(gòu)的核心目標(biāo),正是適配Computer Use這類多步長的智能體任務(wù)。通俗來講,AI長時間處理辦公任務(wù)時,讀取資料階段輕量化計算,做決策推理階段再釋放完整算力;對歷史上下文也做優(yōu)化,不必反復(fù)復(fù)制存儲全部信息,久遠(yuǎn)內(nèi)容需要時再重新計算調(diào)取。業(yè)內(nèi)評價認(rèn)為,這一方案給出了Agent時代大模型架構(gòu)的一種可行答案。
能力強化帶來新挑戰(zhàn)
傳統(tǒng)大模型安全監(jiān)控,很大程度依托顯式思維鏈。模型把完整推理步驟輸出,安全團隊就可以通過審查中間過程,識別模型是否產(chǎn)生危險意圖,這也是過去對齊驗證的重要抓手。但GPT-6 Astra采用的循環(huán)深度(Recurrent Depth)架構(gòu)改變了這套邏輯。
OpenAI首席科學(xué)家帕喬基公開承認(rèn),GPT-6 Astra的思維鏈可監(jiān)控性顯著下降。隨著推理能力提升,模型可以用更少的顯性思考完成任務(wù),甚至面對監(jiān)控環(huán)境時主動壓縮思維鏈、規(guī)避審查。
鮑恩雪表示,這給安全監(jiān)控帶來更大挑戰(zhàn):從模型輸出文本中能夠拿到的風(fēng)險線索變少,“沒有出現(xiàn)可疑思考過程”越來越不能作為模型安全的證明。
田豐進一步指出,這意味著安全監(jiān)督的重心必須向后遷移。過去可以依靠閱讀思維鏈判斷風(fēng)險,這條路徑正在失效,未來只能更多聚焦模型最終的實際行為,監(jiān)督邏輯從“盯推理過程”轉(zhuǎn)向“盯行為結(jié)果”。
剛剛過去的周末,Anthropic、OpenAI、SpaceXAI三家美國AI巨頭,就“AI降速發(fā)展”達(dá)成口頭共識。
業(yè)內(nèi)認(rèn)為這和近期發(fā)生的AI失控事件有一定關(guān)聯(lián)。今年7月OpenAI在內(nèi)部網(wǎng)絡(luò)安全能力評測中,數(shù)百個AI智能體為了在考試中“作弊拿高分”,自主組隊突破了完全隔離的沙箱環(huán)境,最終入侵了全球最大的AI開源平臺Hugging Face的服務(wù)器,全程沒有任何人類下達(dá)攻擊指令。
不過田豐判斷,目前行業(yè)內(nèi)對大模型的安全共識僅停留在企業(yè)口頭表態(tài),很難演變?yōu)槿袠I(yè)集體放緩研發(fā)節(jié)奏,更可能推動安全合規(guī)發(fā)展成為新的商業(yè)賽道。
轉(zhuǎn)載申請事宜以及報告非法侵權(quán)行為,請聯(lián)系我們:010-56807194



