Jev模型爆紅!193倍提速、成本降444倍,AI判斷賽道藏什麼信號?

24 2026-09-21

「過度承諾不是Bug,是feature。」

說出這句話的,是曾在OpenAI參與GPT-4、ChatGPT以及InstructGPT/RLHF相關工作的Diogo Almeida。他現在是Jev模型創始人,而Jev這個不會聊天、不寫代碼、只做判斷的AI,正在開發者圈刷屏。

有人用它40秒分析724條實時廣告,總共做出8724次判斷。有人把它接進Claude Code,專門清理沒用的上下文。還有人讓它給AI Agent當裁判,檢查任務到底有沒有真的完成。LangChain也已經開始測試Jev作為Agent評估器的表現。

TypeSafe公布的測試中,Jev最高提速約193.6倍,成本最多降低444.6倍。輸入每百萬Token只要0.042美元,輸出Token甚至免費。官方公布的端到端延遲低至70到500毫秒,相比前沿模型快20到200倍,價格低40到400倍。

一個能力看起來更少的AI,為什麼反而火了?

Diogo Almeida的履歷很特殊。他曾在OpenAI工作,親手參與構建了今天大模型最重要的後訓練範式之一。但在一個多月前的一場演講裡,他上來就調侃自己,是OpenAI內部少數幾個公開「黑」ChatGPT的人之一。演講主題更加直接:What's Next After RLHF?

他提出一個看起來很矛盾的問題。今天的大模型已經可以挑戰非常難的數學題,代碼、推理和各種benchmark一路往上走。可到了很多企業真正想自動化的業務裡,人卻始終拿不掉。

比如客服。讓AI查資料、總結文檔、起草回覆,沒問題。但如果讓AI自己決定:這筆錢到底退不退?這個用戶要不要賠償?企業一下就謹慎起來了。

明明這些事情看起來比高等數學簡單得多,為什麼反而不敢交給AI?

Diogo給出的答案很簡單:Today's AI is incredible at assistance, not automation.今天的AI很會幫你幹活,卻還不太能自己把活幹完。

Claude Code再強,你通常還是坐在電腦前。它寫代碼,你看;它改文件,你檢查;錯了,你再讓它改。所以在Diogo看來,Claude Code依然屬於ChatGPT開啟的「協助時代」。真正的自動化是什麼?人根本不在場。AI在後台自己判斷、自己執行,一天可能運行幾十萬甚至幾百萬次,你甚至永遠不會看到它做了什麼。

問題也就來了:為什麼今天的AI這麼聰明,卻偏偏離不開人?

Diogo把矛頭指向了一個自己非常熟悉的東西——RLHF。RLHF的基本邏輯其實不複雜:收集人的偏好,然後讓模型越來越符合人的偏好。所以他在演講裡給出了一個非常直白的解釋:為什麼今天的大模型總需要有人在回路裡?因為訓練它的時候,我們字面意義上就把人塞進了那個回路裡。模型從一開始就在學習:什麼樣的回答,人更喜歡?

這也解釋了大模型一個我們已經非常熟悉的特點——哪怕不知道,它也經常能說得特別像那麼回事。Diogo在現場舉了一個很損的例子。有人給ChatGPT發了一段放屁的錄音,告訴它這是自己創作的一首音樂,請它「真誠、坦率」地評價。結果ChatGPT一本正經地誇了起來,說這是一首很有陰森、詭異氛圍感的環境音樂。Diogo甚至用一句話總結:「Overpromising is a feature.」

對於聊天產品來說,這未必致命。用戶還在屏幕前,錯了可以糾正。但真正的自動化系統完全不同。機器不關心你的回答好不好聽,它只需要知道兩件事:到底該怎麼做,以及你到底有多大把握?

Jev模型爆紅!193倍提速、成本降444倍,AI判斷賽道藏什麼信號?

這也就解釋了,為什麼一個多月後發布的Jev,看起來會如此反常。

普通大模型哪怕最終只需要回答「A還是B」,往往也要經過生成Token的過程。Jev直接把這部分砍掉。它目前主要做三件事:Noul,回答Yes還是No;Choice,從幾個選項裡選一個;Score,按照標準打分。然後直接返回判斷和概率。不給你寫小作文,也不陪你聊天。

但真正關鍵的,其實不是「快」,是後面那個概率。為此,TypeSafe提出了一套新的訓練方法:RLCD,Reinforcement Learning for Calibrated Decisions,校準決策強化學習。它想解決的問題非常現實:如果AI告訴你一件事有80%的概率發生,這個80%到底能不能信?

理想情況下,模型判斷為80%概率的一批事情,最後就應該大約有80%真的發生。這在自動化系統裡非常重要。99%的把握,可以直接執行。51%的把握,可以扔給更強、更貴的大模型,甚至轉給人。真正麻煩的不是AI不知道,是AI不知道自己不知道。

所以Jev真正想改變的,是AI輸出的對象。過去ChatGPT生成的答案,主要是給人看的。Jev給出的判斷和概率,則是準備直接交給軟件用的。

這也解釋了為什麼Jev偏偏在現在火了。因為Agent真正運行起來以後,會產生海量的小判斷:下一步調用哪個工具?這個網頁該點哪個按鈕?這條信息還有沒有用?任務到底完成沒有?結果要不要重新檢查?

這些問題單個看都不難,但一個Agent一天可能需要判斷幾十萬、幾百萬次。如果每一次都叫最強的大模型,花幾秒鐘「深思熟慮」,再吐出一大段Token,成本和延遲很快就上去了。Jev想搶的,就是這一層。大量高頻的小決定交給Jev,真正需要複雜推理的任務,再交給大模型。

這也是為什麼TypeSafe把Jev叫做System One Model。這個概念來自丹尼爾·卡尼曼的「系統1」和「系統2」:一個負責快速、直覺式的判斷,一個負責慢速、複雜的思考。Jev甚至连名字都來自「傑文斯悖論」:一種資源變得越來越便宜,人們未必會少用,反而可能用得更多。如果調用一次AI很貴,你只會把它用在最重要的地方。但如果一次AI判斷便宜到幾乎可以忽略呢?一封郵件、一條日誌、一次工具調用、一個網頁按鈕、Agent執行的每一步,都可能加入一次AI判斷。

說實話,現在就說Jev代表下一代AI,還太早。它所謂的「零幻覺」,更多意味著不會跳出規定的答案類型亂編,不代表不會選錯;193.6倍、444.6倍這樣的極端數據,也主要來自TypeSafe自己的測試。

但Jev這次爆火真正值得關注的,可能不是它能不能挑戰GPT或者Claude。而是一個參與造出ChatGPT的人,正在重新追問一個更底層的問題:過去幾年,整個行業都在想,怎樣讓AI想得更久、說得更多。但如果未來真正需要的是幾十億次機器之間的判斷,AI為什麼每一次都要先「說一段話」?

ChatGPT教會了機器怎麼和人說話。而Jev押注的下一步是:當人不再坐在屏幕前,機器能不能自己做決定?

FAQ

Q1:Jev模型和ChatGPT最大的差別是什麼?
A:ChatGPT主要生成給人看的文字答案,Jev則直接輸出判斷與概率,不寫長篇回覆。它只做Yes/No、選擇題和打分三類任務,目標是讓軟件直接調用,而非陪人聊天。這種設計讓它在延遲和成本上大幅低於前沿大模型。

Q2:RLHF為什麼被認為不適合AI自動化?
A:RLHF讓人類偏好進入訓練回路,模型學會討人喜歡,甚至不確定也說得煞有介事。這對聊天產品無傷大雅,但自動化系統需要的是準確判斷和可信概率,而非討好用戶。Diogo Almeida認為,這種訓練方式可能讓AI難以真正獨立執行任務。

Q3:RLCD校準決策強化學習解決什麼問題?
A:RLCD試圖讓模型輸出的概率真正可信。例如模型說80%概率發生,實際就該有大約80%發生。這在自動化決策中至關重要,因為系統需要根據把握程度決定直接執行、轉交更強模型或交還人類,避免AI不知道自己不知道。

上一篇 微軟納德拉嗆不受控AI!馬斯克奧特曼齊表態,開源與封閉模型之爭升溫
下一篇:QQLink推USDT掃碼支付!大馬華人搭車不再換馬幣
相关文章
返回顶部小火箭