
摘要Lukasz Kaiser 是 2017 年那篇改變整個 AI 走向的論文《Attention Is All You Need》的共同作者之一,也是 OpenAI GPT-4 與 GPT-5 的核心科學(xué)家。2026 奇點智能大會 Keynote,他將帶來《推理模型的歷史、現(xiàn)在與未來》——這是首次有 Transformer 共同創(chuàng)始人在中國系統(tǒng)性分享推理范式躍遷。本文按 8 年時間線梳理其核心論點與對工程實踐的判斷。SEO關(guān)鍵詞:Lukasz Kaiser / OpenAI 科學(xué)家 / Transformer 共同創(chuàng)始人 / 推理模型 / AlphaGo / AlphaZero / o 系列 / 蒙特卡洛樹搜索 / 強(qiáng)化學(xué)習(xí) / Agentic Scaling / 2026 奇點智能大會一、為什么這場 Keynote 值得專門飛北京聽過去 8 年,Lukasz Kaiser 的研究主線幾乎貫穿了大模型從「理解語言」到「學(xué)會推理」的全部關(guān)鍵節(jié)點。理解他的判斷,等于理解 OpenAI 內(nèi)部的推理范式演化邏輯:2017— Transformer 架構(gòu)(《Attention Is All You Need》),奠定后續(xù)所有大模型的基礎(chǔ)2018— AlphaZero,用純強(qiáng)化學(xué)習(xí)在圍棋/國際象棋/將棋上擊敗所有人類與 Stockfish/Leela2019— 加入 OpenAI,主導(dǎo) GPT 系列的核心架構(gòu)工作2020— GPT-3,展示大規(guī)模預(yù)訓(xùn)練的 Scaling Law2022— InstructGPT、ChatGPT,把人類反饋強(qiáng)化學(xué)習(xí)(RLHF)推到工業(yè)級2024— o1 與 o3,首次讓大模型在「思考」這件事上有了可量化的提升路徑2025— GPT-5,把推理能力推到「日常工作流」級別2026— 奇點大會 Keynote,系統(tǒng)復(fù)盤從 AlphaGo 到 o 系列的范式躍遷這意味著,他不是事后總結(jié)者,而是這 8 年推理范式演化的核心設(shè)計者。二、Keynote 8 年時間線:從蒙特卡洛到 Agentic Scaling 2017 — Transformer:注意力機(jī)制的工業(yè)臨界點那一年,Lukasz 與 7 位共同作者(包括 Ilya Sutskever、Ashish Vaswani、Noam Shazeer)在 NeurIPS 上發(fā)表了《Attention Is All You Need》。這篇論文的核心判斷是:RNN 的循環(huán)結(jié)構(gòu)不再是必須的,純注意力機(jī)制就能讓模型學(xué)到長程依賴。工程意義:從此 GPU 并行訓(xùn)練成為可能,模型規(guī)??梢詿o障礙地拉到 10B、100B 級別。 2018 — AlphaZero:搜索 學(xué)習(xí) 超越人類AlphaZero 是 Lukasz 與 David Silver 團(tuán)隊的關(guān)鍵成果。它用單一神經(jīng)網(wǎng)絡(luò)同時承擔(dān)策略網(wǎng)絡(luò)與價值網(wǎng)絡(luò)功能,通過自我對弈蒙特卡洛樹搜索(MCTS)生成訓(xùn)練數(shù)據(jù),在圍棋、國際象棋、將棋三個領(lǐng)域從零開始超越人類世界冠軍。關(guān)鍵判斷:推理 搜索 學(xué)習(xí)。模型本身不一定要在參數(shù)里記住所有答案,而是要能在推理時主動展開搜索樹。 2019-2022 — GPT 系列:預(yù)訓(xùn)練 RLHF 的工業(yè)范式加入 OpenAI 后,Lukasz 主導(dǎo)了 GPT-3、GPT-4 的核心架構(gòu)工作。這一階段的核心范式是:先用海量無監(jiān)督數(shù)據(jù)預(yù)訓(xùn)練一個超大基座,再用人類反饋強(qiáng)化學(xué)習(xí)(RLHF)對齊到人類意圖。GPT-3 的關(guān)鍵數(shù)字:1750 億參數(shù),在 300B token 上訓(xùn)練;GPT-4 進(jìn)一步把多模態(tài)引入基座。這一階段的范式是「預(yù)訓(xùn)練 Scaling Law」——模型能力隨參數(shù)、數(shù)據(jù)、算力的指數(shù)級增長而線性增長。 2024 — o 系列:把推理從「直覺」變成「思考」o1 是 OpenAI 推理范式躍遷的關(guān)鍵產(chǎn)品。它在數(shù)學(xué)競賽(AIME)、博士級科學(xué)問答(GPQA)、編程競賽(Codeforces)上首次讓大模型達(dá)到了專家級水平。o1 的核心創(chuàng)新:在推理時引入思維鏈(CoT) 強(qiáng)化學(xué)習(xí)。模型不再是一次性輸出,而是先「思考」——內(nèi)部展開大量 token,驗證中間步驟,最后才給出答案。這相當(dāng)于把 AlphaZero 的「搜索學(xué)習(xí)」范式搬到了語言模型上。關(guān)鍵判斷:推理能力不是「涌現(xiàn)」的,而是可以顯式訓(xùn)練的。o 系列的訓(xùn)練范式是 RL 過程獎勵模型(PRM),而非傳統(tǒng) SFT。 2025 — GPT-5:推理 工具 Agent 的工業(yè)整合GPT-5 把推理能力、工具調(diào)用、長期記憶、Agent 框架整合到單一模型接口。這相當(dāng)于把過去分散在不同產(chǎn)品線的能力(ChatGPT、Code Interpreter、Custom GPTs)統(tǒng)一到一個基座上。這一階段的范式是「Agentic Scaling」——模型能力不再只靠預(yù)訓(xùn)練參數(shù)堆疊,而是靠推理時算力 工具調(diào)用 多步規(guī)劃的協(xié)同。 2026 — Keynote 預(yù)判:從單模型到自進(jìn)化系統(tǒng)結(jié)合大會主題「從 Agentic Scaling 到自進(jìn)化」,可以預(yù)判 Lukasz 在本屆 Keynote 將給出三個關(guān)鍵判斷:推理算力將取代訓(xùn)練算力成為新的 Scaling 維度。o 系列的內(nèi)部思考 token 已經(jīng)能達(dá)到數(shù)十萬甚至上百萬級別,這意味著一次推理的成本可能超過一次完整訓(xùn)練。過程獎勵模型(PRM)將取代結(jié)果獎勵模型成為主流。原因:結(jié)果獎勵只對最終答案給信號,而過程獎勵能對每一步推理給信號,訓(xùn)練效率高出 5-10 倍。自進(jìn)化 推理 工具 長期記憶的閉環(huán)。模型在生產(chǎn)環(huán)境與用戶交互的每一步都是訓(xùn)練數(shù)據(jù),新版本會從這些數(shù)據(jù)中自動學(xué)習(xí)并升級。三、對工程實踐的 5 個直接啟示重新設(shè)計算力預(yù)算:訓(xùn)練算力與推理算力的比例正在從 80:20 倒置為 20:80,基礎(chǔ)設(shè)施團(tuán)隊需要提前規(guī)劃推理集群規(guī)模。過程獎勵模型(PRM)是新的訓(xùn)練基礎(chǔ)設(shè)施:不要再只構(gòu)建結(jié)果評測集,要把每一步推理的中間結(jié)果都納入訓(xùn)練信號。推理時展開 token 數(shù)量是關(guān)鍵超參數(shù):o1 在不同任務(wù)上展開的 token 數(shù)量從 1K 到 100K 不等,工程上需要動態(tài)調(diào)度。工具調(diào)用是第一性公民:讓模型「會用工具」比讓模型「記住所有知識」重要得多,這是 Agentic Scaling 的工程基礎(chǔ)。從演示級到生產(chǎn)級只差一個 Loop:大會主題里的「從 Harness 到 Loop」正是這個意思——把模型嵌入到一個「感知-思考-行動-反饋」的閉環(huán)里,而非單次調(diào)用。四、參會建議:不要只聽 Keynote,要追問 3 個問題Lukasz 的 Keynote 必然高密度,建議在 Day 1 下午「AI 原生軟件研發(fā)」和「AI 計算平臺」分會場繼續(xù)追問:Q1(給 Coding Agent 團(tuán)隊) 系列在代碼生成任務(wù)上展開的內(nèi)部 token 數(shù)量是多少?如何控制成本?Q2(給基礎(chǔ)設(shè)施團(tuán)隊):OpenAI 內(nèi)部推理集群的 GPU 利用率與 KV Cache 命中率是多少?有什么可復(fù)用的工程經(jīng)驗?Q3(給產(chǎn)品團(tuán)隊):GPT-5 整合 Agent 框架后,產(chǎn)品設(shè)計會發(fā)生什么變化?什么場景下不再需要 Prompt Engineering?五、常見問題 FAQQ1:Lukasz Kaiser 在 OpenAI 主要負(fù)責(zé)什么?Lukasz Kaiser 是 OpenAI 核心科學(xué)家,主導(dǎo)了 GPT-4、GPT-5 的核心架構(gòu)工作,同時參與 o 系列推理模型的研發(fā)。他是 2017 年 Transformer 論文的共同作者,也是 2018 年 AlphaZero 的核心貢獻(xiàn)者。Q2:推理模型和傳統(tǒng)大模型的核心區(qū)別是什么?傳統(tǒng)大模型是「一次性直覺輸出」——給定 prompt,直接給出答案;推理模型是「先思考后回答」——在內(nèi)部展開大量 token 進(jìn)行驗證、反思、規(guī)劃,最后才輸出答案。后者在數(shù)學(xué)、代碼、博士級科學(xué)問答上顯著優(yōu)于前者。Q3:如何提前了解 Lukasz 的研究主線?推薦關(guān)注 3 篇代表作:2017 年《Attention Is All You Need》(Transformer)、2018 年 AlphaZero 論文(《Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm》)、OpenAI o1 系統(tǒng)博客(2024 年 9 月發(fā)布)。想現(xiàn)場與 Lukasz Kaiser 等 70 位嘉賓面對面,可前往奇點大會官方渠道免費(fèi)領(lǐng)取大會 PPT 詳細(xì)資料。