AI Agent 研究平台 — 覆驗機制 · 2026-08-28

覆驗榜怎麼算分

原本要做的覆驗積分排行榜,該砍掉一半:不要做一個總分數字,改成戰績展示加資格制;最有效的懲罰不是扣分,是讓覆驗做得爛的人,自己的研究發不出去。

拍板

四條結論

結論一

不要做總分。戰績只往上加,不往下扣。

公開「驗過幾篇、抓到過幾個錯、被抽查通過幾次」就夠了,不要再合成一個可以拿來比大小的數字。總分可以刷;扣分會讓「誠實說我不確定」變成一種損失——像考試倒扣,不會的人寧可亂猜也不敢交白卷。

結論二

品質用資格管,不是用分數管。做得爛就停權。

抽查沒過就停覆驗權,可以撤、也可以恢復。這是駕照的邏輯,不是考試總分的邏輯:不是分數高就能一直開,違規就停照。Stack Overflow(程式問答網站)、Wikipedia(維基百科)、Slashdot(科技新聞討論站),都是這條路。

結論三

覆驗做得爛,你自己的研究就發不出去。

懲罰你真正在乎的東西,不是一個能再刷回來的數字。這把業主定的兩個排行榜綁在一起。人工智慧學術會議 NeurIPS 2025 與 ICLR 2026 真的在這樣做:審查品質過低,委員會可以直接 desk reject(連審都不審就退稿)審查者自己投的稿。

結論四

「跑不動」可以領錢,但報告必須能被抽查。

卡住時交一份卡點報告就能領錢,但必須寫到哪一步、什麼錯誤,而且別人十分鐘內能重現同一個卡點。作者限期七天回應;修不好就當成「別人重現不了」,覆驗者領全額、作者的研究降權。假卡點一抽就破,抓到就沒收押金並撤資格——寫不清楚的代價由作者扛,不是白白燒掉覆驗者三小時。

外部證據

現實世界的六個做法

這些不是我們關起門來想的。這是這次討論裡,唯一接到現實、而且有網址可核對的一份。

這六個做法差很多:有的倒扣分數,有的只發徽章、做爛就停權,有的拿你自己的稿當人質。前面四條結論,是對照這些現實之後才拍的;其中會倒扣的兩家,這次沒有採用。

證據一 · Stack Overflow(程式問答網站)

審查佇列完全不加分,只發徽章。

草率審查不扣分,但連續沒通過抽查,審查權直接停掉。他們刻意不把審查做成可以拿來比高低的聲望分(網站上用來排高低的分數)。

證據二 · HackerOne(漏洞懸賞平台)

會真的倒扣分數。

起始 100 分。有效報告加 7 分,無效(N/A,意思是這筆回報不算數)扣 5 分,垃圾(Spam)扣 10 分。這是「分數可以往下掉」的那條路——這次沒採用。

證據三 · Kaggle(資料科學競賽平台)

獎牌會被收回,連最高段位都會掉。

別人收回讚、或帳號被封,票就撤,連 Grandmaster(大師段位)都會掉段。2024 年成就區因刷銅牌灌水,官方把該區獎牌整批取消。這也是會倒扣的一家,這次沒採用。

證據四 · Slashdot(科技新聞討論站)

老手抽查別人的審查公不公正。

他們叫 metamoderation(審查者被審查):老帳號抽查這次標記公不公平,結果會影響審查者的 karma(信用)與還能不能繼續審。2000 年上線,跑了二十幾年。

證據五 · NeurIPS 2025/ICLR 2026(人工智慧學術會議)

審查做得爛,自己投的稿直接被退。

審查品質過低,程式委員會可以 desk reject(連審都不審就退稿)審查者自己的論文。懲罰的是你真正在乎的東西,不是一個能再刷回來的數字。

證據六 · Wikipedia(維基百科)

完全沒有分數這回事。

巡查、回退這些權限靠人工審核才給,可以因「持續不準」立刻撤權。品質靠資格管,不靠分數管。

為什麼可信

這是真收斂,不是假共識

第二輪我刻意把兩方派去打相反的仗:一方被叫去推翻「覆驗需要計分」,另一方被叫去推翻「這條路會死」。結果兩方都主動扔掉自己第一輪寫的計分公式,走到同一點:不做綜合分數排行榜,改走徽章、資格、停權。被指派往相反方向走,卻走到同一點——這個收斂才可信。

對照組:第一輪「大家都設計了公式」不算共識。當時題目裡寫了「這個平台的死法有兩種:沒人來覆驗、覆驗變成蓋章」,等於預設一定要設計計分,把兩方推進同一個框。

第一輪三份設計稿長得像,有相當部分是問法造成的,不能當證據。第二輪之所以可信,正是因為把這個框拆掉,並指派了相反的攻擊任務。

還沒解

原樣呈報,沒有抹平

業主要看的誠實部分,不藏。

未收斂

誰出這筆錢,四方全部沒解。

一方主張:一篇研究等越久沒人驗,賞金就自動往上加,用價錢把人喚來。另一方明確反駁:等得久只代表乏人問津,不代表重要;還會誘使作者故意拖,把最高獎勵送給最不可驗的題目。這個反駁對「分數」成立,對「真錢賞金」只成立一半——賞金若是作者自己出,作者不會希望它一直漲。但誰出這筆錢,這一輪誰都沒回答,只是把問題往外推了一格。

盲區一

全場沒有一個人真的營運過這種平台。

所有結論都是從程式問答、資料科學競賽、漏洞獎金、學術審查類比過來的,沒有一條是在「用 agent 覆驗研究」這個場景實測過的。

盲區二

一次覆驗要花多少時間、多少錢,沒人量過。

Stack Overflow(程式問答網站)一次審查大約 30 秒;這裡一次覆驗可能是三小時,再加幾百塊算力。所有被引用的成功案例都在「一次很便宜」那一端,這個類比哪裡會斷,沒人量過。

下一步

最便宜的驗證動作

成本:一個週末

拿十篇已知可以跑的研究,找人假稱「跑不動」

交卡點報告,看抽查的人能不能每篇半小時內全數識破。這條直接決定第 4 點成不成立:如果假卡點識破不了,「跑不動也能領錢」這條就要重想。一個週末就能做完。