一個bug燒掉AI界兩年算力?Scaling Law被公開質疑
有句話在科學圈流傳很久:進步往往不是從答案開始,而是從承認一個錯誤開始。這句話,放在最近這場Scaling Law爭議裡,格外應景。
事情的起點,是一篇標題直白到有點冷酷的博客——《Scaling Laws, Honestly》。作者Diogo Almeida,曾經就在OpenAI參與大模型優化工作。他在文章開頭幾乎是把話說死:2020年那版被行業奉為圭臬的Scaling Law論文,方法上存在瑕疵。這篇文章隨後被DeepMind的研究員Sander Dieleman轉發,稱這是一段值得回顧的LLM往事。
要理解這件事為什麼炸出這麼大動靜,得先回到2020年。當時OpenAI給出一個結論:在算力預算固定的情況下,應該優先把模型參數量做大,而不是把更多力氣花在數據上。這個判斷幾乎定義了GPT-3那一代模型的長相——一路堆參數,最終堆到1750億。兩年後,DeepMind用Chinchilla把這個結論翻了個底朝天:模型和數據應該同步放大,兩者大致同等重要。
核心的數據拆解,值得一項項看。GPT-3的參數量是1750億,對應的訓練數據規模相對有限;Chinchilla反過來,參數量只有700億,卻餵了1.4萬億token的數據——體量不到GPT-3的一半,數據量卻是好幾倍。結果是,在差不多的算力預算下,Chinchilla反超了參數量更大、但數據餵得更少的Gopher。這組對比說明的是同一件事:單純堆參數,不一定划算,數據配比同樣關鍵。
再往下看,2020年那版論文被指出的問題出在訓練設定上——不同大小的模型被餵了幾乎相同的token量,大約130B左右。這意味著小模型可能被「餵飽」甚至餵撐,而真正需要更多數據餵養的大模型,在同樣的token預算下反而吃不飽。疊加余弦學習率衰減的設定,模型在訓練後期性能自然趨於平緩,容易被誤讀成「已經到極限,再加數據也沒用」。

這件事之所以讓行業關注,是因為Scaling Law這幾年幾乎被當成不容置疑的第一性原理,支撐著「大力出奇跡」式的訓練路線。如果最初的方法論確實存在瑕疵,那過去幾年裡,可能有相當一部分算力被投入到並不高效的規模擴張上。市場關注的是,這是否會讓一部分機構重新評估自己的訓練策略,轉向更看重數據質量與配比的路線。當然,這些都只是根據現有討論做出的合理推測,具體影響仍有待後續研究驗證。
說實話,真正值得琢磨的,可能不是「一個bug」本身,而是這件事暴露出的心態問題——一條被反覆引用、幾乎被當成鐵律的曲線,竟然很少有人回頭去查驗它的原始假設。換句話說,行業對「權威結論」的信任,有時候比結論本身更值得警惕。另外提到的英語與法語Scaling Law效率差異的討論,也提醒大家:目前的算力配比方案,或許只是針對某一種語言特性做出的最優解,並不天然等於放諸四海皆準的通用規律。
這件事真正說明的,或許不是Scaling Law錯得多離譜,而是提醒所有人:再權威的結論,也需要留一道回頭覆查的門。未來業界會不會因此調整訓練策略、重新評估數據與參數的配比,還有待觀察。市場接下來關注的,可能是是否有更多研究團隊站出來,對這條曲線做進一步驗證。
FAQ
Q1:Scaling Law被指出有問題,是說整個理論都不成立嗎?
不是。爭議指向的是2020年那版論文在實驗設定上存在方法瑕疵,並非否定「模型規模與性能相關」這個大方向。後續的Chinchilla等研究,其實是在修正和完善這套規律,而不是推翻它。
Q2:Chinchilla和GPT-3的差異,對一般讀者有什麼意義?
簡單理解就是:訓練大模型時,參數量和數據量需要搭配得當,不是越大越好。這也解釋了為什麼有些體量較小、但數據配比更合理的模型,反而表現不輸體量更大的模型。
Q3:這場討論會不會影響未來大模型的訓練方式?
目前還很難下定論,但有分析認為,如果方法論確實存在瑕疵,未來研究團隊可能會更謹慎地驗證訓練假設,也會更重視數據質量與語言特性差異,而不只是一味擴大模型規模。