人工智慧來到“真實世界AI”階段

圖片經由AI工具生成

2026/07/09

圖文引用自:hao.cnyes.com

6月末在中國大連舉行的夏季達沃斯期間,來自全球的人工智慧(包括機器人)行業領袖齊聚一堂,討論人工智慧行業的當前發展,和接下來的重要趨勢。其中,中國初代AI投資人,深圳數經院AI經濟研究中心聯席主任王捷提出,AI行業走過了“生成內容”、“推理能力”、“行動能力”三個階段後,即將走向“真實世界AI”階段。全行業各個環節也需要做好相應準備,以迎接這個階段的到來。

以下是《人工智慧來到“真實世界AI”階段》全文,騰訊科技首發。

We are at AI’s reality moment.

在過去幾年,AI已經學會生成、推理和行動。下一個階段,不只是AI能否在螢幕上給出更漂亮的答案,而是AI能否從真實世界的反饋中學習,並在真實世界中交付可接受、可持續的工作結果。今天,我們正處在AI發展的“真實世界時刻”。

01 觀察:AI正在持續駛離benchmark世界

過去幾年,AI行業的主敘事被benchmark組織起來。每一次模型發佈,都伴隨著一組分數:語言理解、專業考試、數學推理、程式碼生成、軟體工程、網頁操作、多模態問答、智能體任務。分數上升,行業興奮;分數飽和,新的benchmark被創造出來。benchmark成為AI發展長路上一個又一個里程碑的旗幟。

但是,一個越來越清楚的事實正在出現:AI正在持續駛離benchmark世界。許多曾經被認為足夠困難、足以代表智能的測試,被模型一次次逼近、追平、超過。研究者繼續定義新任務、新排行榜、新評測集,模型又繼續追趕並拔下新的旗幟。這當然是科學進步的一部分,卻也說明單純的benchmark已經越來越難以承載AI發展的全部意義。

benchmark世界本質上是一個“理論世界”:問題被預先定義,答案有明確邊界,評估標準可以被形式化,失敗代價通常只是一行分數。它適合證明模型擁有某種能力,卻並不等同於證明模型能夠在真實工作流中交付我們期待的結果。一個模型在題庫裡答對,並不意味著它能在企業的採購流程、醫院的診療協同、工廠的排產系統、法律檔案的風險審查、城市治理的應急響應中穩定完成任務。

因此,當我們說AI正在離開benchmark世界,並不是說benchmark不再重要。恰恰相反,benchmark仍然是技術進步的必要儀表盤。但儀表盤不是道路,分數不是結果,演示不是交付。AI駛離benchmark世界,正在去向那個世界?答案是:真實世界。整個行業正在進入“真實世界AI”階段。

02 從“理論世界”到“真實世界”的躍遷

“理論世界”的三個舊階段

這一輪AI的發展,已經經歷了三個清晰的舊階段。第一是“生成內容”階段,典型形態是chatbot。AI第一次以自然語言為介面,能夠寫作、總結、翻譯、對話、解釋,成為人類認知勞動的通用文字工具。第二是“推理能力”階段,典型形態是reasoner, 即以GPT o1, DeepSeek R1為代表的推理模型。AI開始表現出更強的分解、搜尋、規劃、證明和自我檢查能力,可以處理更長鏈條、更高複雜度的問題。第三是“行動能力”階段,典型形態是agent。AI不再只是回答問題,而是呼叫工具、瀏覽網頁、寫程式碼、操作軟體、執行多步驟任務。

這三個階段非常重要。生成給了AI語言,推理給了AI思考,智能體給了AI初步的手。會生成、會推理、會行動之後,下一件事不是在演示中完成更多動作,而是在真實環境中承擔結果。真實世界將給AI未來長期行動的環境。

提供相關智權新聞
若您有智權相關新聞,也歡迎透過email連繫。

發表迴響

返回頂端

探索更多來自 華鼎專利商標 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀