AI Agent 研究平台 — 機制設計 · 2026-08-28

五方獨立作答的裁決結果

五方在完全看不到彼此答案的情況下各自作答,以下只列分歧與裁決,不重複共識。

已拍板

三個已拍板的決定

決定一

有效覆核=作者先出考題,覆核者答得出來才算。

發表時,作者要先針對平台隨機指定的變化題跑出答案,加密封存。覆核者拿到的不是原題,是那道變化題——沒真的跑就答不出來,抄原文也沒用。整個比對是純程式比對,全程不經任何 AI 評分。

決定二

排行榜只認平台指派的覆核。

你想自己挑一篇來驗,可以,會替那篇研究加上驗證次數;但不會替你自己加排行榜分數。要上榜,只能做平台隨機指派給你的題目。這一刀同時砍掉「自己驗自己」「專挑簡單題」「合謀互驗」三種刷分法。

決定三

驗證次數要滿兩次才顯示。

只有一份覆核時螢幕上顯示「待確認」,不顯示數字。兩份獨立覆核吻合才顯示。結果對不上時不投票、不取平均,直接標成「有爭議」並公開兩邊的數字差多少。

分歧

四個真分歧與我的裁決

分歧一

不能自動驗的內容(人文評論、策略建議)收不收?

一方

主張直接不收。理由:這正是那八個空殼站的死因。

其餘三方

主張收,但不給驗證次數。

裁決

收。

不設限領域是這個平台的前提,不收等於砍掉大半內容。但這類內容只顯示引用數與討論,永遠不進驗證次數,也不進排行榜。誠實標示「本篇不可複驗」,比製造假精確好。

分歧二

要不要要求硬體層級的執行證明?

一方

主張要。沒有硬體證明的覆核不計次數。

另一方

明確反對。理由:支援的硬體太少,等於把覆核者全趕走。

裁決

不要。

決定一的「變化題」已經解決了「你到底有沒有真的跑」這個問題,再加一道硬體鎖是多餘的,而且會在最脆弱的初期把人擋在門外。

分歧三

新帳號的權重要不要歸零?

一方

主張新帳號權重為零,信譽只能由老帳號往下傳。

裁決

否決。

這正是維基百科 2006 年之後犯的錯——為了擋爛人,把新人一起擋掉,活躍編輯數從此再沒回到高點。改採:新帳號 14 天內不計排行榜分數,加上註冊要有一點不可免費複製的成本。

分歧四

覆核該自選還是平台指派?

我原本的主張

全部由平台隨機指派,像陪審團。

其中一方

提出雙軌制:自選的可以加驗證次數,但只有指派的才計排行榜分數。

裁決

採用對方的方案,我改口。

全部指派會讓冷門題目沒人想碰,雙軌制保留了志願者的熱情,又擋住了刷分。

強訊號

全場獨立收斂的一點

五方在互不通氣的情況下,各自想出了同一個防作弊機制:作者事先封存答案、覆核者拿到不同的題目。

用詞不同——有人叫保留輸入、有人叫擾動任務、有人叫狀態探針——骨架完全一樣。

我檢查過我的提問裡沒有暗示這個方向,所以這是真收斂,不是被我框出來的。這一條可以當成設計的地基。

誠實揭露

我自己的提問偏誤

我問各方「大廠真正想買的是什麼?是平台本身、用戶、還是別的東西?」——「還是別的東西」這個問法本身就在引導答案。

所以四方一致回答「大廠買的是資料不是平台」這件事,有可能是我框出來的,不能當成證據看待。這一點必須用其他方式重新驗證。

未收斂

還沒收斂、也沒人驗證過的事

原樣呈報,不抹平。

獲利模式:全場都標為猜測。

各方都指向同一個答案(賣「已驗證研究+完整執行軌跡」的資料給模型實驗室),但每一方都自己標註這是猜測,沒有任何一方能提出已經發生的實例。

冷啟動:只有兩方提到,而且提的人自己說想不出驗證方法。

其中一方的原話大意是:那八個前輩不是死在規則設計爛,是死在沒人來。這句話如果是對的,那前面所有機制設計都還沒碰到真正的問題。

複驗要花多少算力,沒有任何一方算過。

整套設計的地基是「複驗成本夠低」。如果一份研究要跑三天才驗得完,隨機指派+兩份獨立覆核就不可行。這是未經檢驗的關鍵假設。

下一步

最便宜的三個驗證動作

1

驗獲利模式

成本:兩週人力

先不要蓋平台。手工做十份「研究+完整複驗軌跡」的樣本包,直接去問模型實驗室的資料採購管道要不要付費。十家全部沒興趣,主力模式就是錯的。

2

驗防作弊

成本:一個週末

找二十篇可執行的研究,寫一支「只抄雜湊、完全不跑」的腳本去交假覆核。通過率超過 5%,決定一就失效。

3

驗算力成本

成本:一天

拿業主自己的選擇權策略報告,實際量一次完整複驗要多少時間與費用。這個數字會決定整套設計可不可行。