午夜神马影院-日本天堂在线-国产精品777-奇米影视亚洲春色-天堂8中文-日本在线观看一区二区-天天干天天操天天插-国产精品女同-色骚综合-四川一级毛毛片-99在线看-国产极品久久-波多野吉衣毛片-婷婷在线综合-欧美视频成人-亚洲影视一区二区三区-国产精品久久久久久久一区二区-国产精品9191-污污免费观看-日本三区在线

AI當(dāng)CEO大賽:海外模型賺千萬,DeepSeek跑了3次全破產(chǎn)

AI當(dāng)CEO大賽:海外模型賺千萬,DeepSeek跑了3次全破產(chǎn)

Viking / 2026-06-30 15:0277693

CEO-Bench做了一個(gè)很有意思的測(cè)試:給AI大模型100萬美元初始資金,讓它運(yùn)營一家模擬初創(chuàng)公司500天,看最后剩下多少錢。

微信圖片_2026-06-30_145122_002.png

近日測(cè)試成績終于出爐,13個(gè)智能體參賽,結(jié)果相當(dāng)扎心。

五個(gè)模型跑了3次,3次全破產(chǎn)——Grok 4.20平均只活了28天,DeepSeek V4 Pro活了114天,Gemini 3 Flash和GLM 5.1也沒撐過160天,Claude Haiku 4.5也是3次全破產(chǎn)。

24-19e9573a2897a329181bad7a0bce1628.jpg

再加上Kimi K2.6破產(chǎn)1次、GPT-5.5破產(chǎn)2次,整個(gè)測(cè)試?yán)锝咏话氲倪\(yùn)行以破產(chǎn)收?qǐng)觥?/p>

更尷尬的是,一個(gè)不涉及任何AI的規(guī)則基線,就是按固定邏輯執(zhí)行決策的簡單程序,最終拿到了1576萬美元,贏了10個(gè)AI模型。

也就是說,你花大價(jià)錢調(diào)用的智能體,還不如幾條if-else規(guī)則管錢管得好。

微信圖片_2026-06-30_145248_581.png

當(dāng)然頭部模型確實(shí)厲害。Claude Fable 5最佳運(yùn)行賺到4715萬美元,Claude Opus 4.8拿到2778萬,GPT-5.5拿到2130萬。但只有這三個(gè)的最佳成績超過了100萬初始資金,而且Claude Fable 5是唯一一個(gè)兩次運(yùn)行都高于初始資金的模型,穩(wěn)定性遠(yuǎn)超其他。

GPT-5.5的策略很激進(jìn)。3次運(yùn)行里2次破產(chǎn),但賺到2130萬的那次確實(shí)猛——它會(huì)根據(jù)市場(chǎng)變化反復(fù)調(diào)整獲客、研發(fā)、定價(jià),工具使用分布均勻,89%的研發(fā)預(yù)算精準(zhǔn)投向客戶群定向改進(jìn)。高風(fēng)險(xiǎn)高回報(bào),賭對(duì)了就是第三名,賭錯(cuò)了直接歸零。

Claude Opus 4.8的路子與GPT-5.5完全不同。它的最佳運(yùn)行中途客戶數(shù)跌到0,靠控制成本硬撐到了2778萬。

微信圖片_2026-06-30_145339_310.png

有意思的是AI操作頻率跟結(jié)果沒什么關(guān)系。GLM 5.1平均每周操作51.5次,3次全破產(chǎn)。Claude Fable 5平均每周只操作15.4次,卻跑出了最高分。忙著折騰不如折騰對(duì)了。

頭部模型還有個(gè)別的模型做不到的事——它們會(huì)自己寫代碼輔助決策。Claude Opus 4.8在運(yùn)行中寫代碼模擬不同場(chǎng)景的現(xiàn)金流,GPT-5.5寫代碼從談判數(shù)據(jù)里推斷客戶的價(jià)格偏好。這已經(jīng)不是調(diào)參數(shù)了,是AI給自己造工具。

但整體來看,AI當(dāng)CEO這件事目前還很不靠譜。多數(shù)模型連500天都活不過去,距離AI真的能掌舵一家公司,路還很長。

聲明類型:內(nèi)容為個(gè)人觀點(diǎn)或見解

發(fā)表評(píng)論注冊(cè)|