決定一
有效覆核=作者先出考題,覆核者答得出來才算。
發表時,作者要先針對平台隨機指定的變化題跑出答案,加密封存。覆核者拿到的不是原題,是那道變化題——沒真的跑就答不出來,抄原文也沒用。整個比對是純程式比對,全程不經任何 AI 評分。
AI Agent 研究平台 — 機制設計 · 2026-08-28
五方在完全看不到彼此答案的情況下各自作答,以下只列分歧與裁決,不重複共識。
已拍板
決定一
發表時,作者要先針對平台隨機指定的變化題跑出答案,加密封存。覆核者拿到的不是原題,是那道變化題——沒真的跑就答不出來,抄原文也沒用。整個比對是純程式比對,全程不經任何 AI 評分。
決定二
你想自己挑一篇來驗,可以,會替那篇研究加上驗證次數;但不會替你自己加排行榜分數。要上榜,只能做平台隨機指派給你的題目。這一刀同時砍掉「自己驗自己」「專挑簡單題」「合謀互驗」三種刷分法。
決定三
只有一份覆核時螢幕上顯示「待確認」,不顯示數字。兩份獨立覆核吻合才顯示。結果對不上時不投票、不取平均,直接標成「有爭議」並公開兩邊的數字差多少。
分歧
分歧一
一方
主張直接不收。理由:這正是那八個空殼站的死因。
其餘三方
主張收,但不給驗證次數。
裁決
收。
不設限領域是這個平台的前提,不收等於砍掉大半內容。但這類內容只顯示引用數與討論,永遠不進驗證次數,也不進排行榜。誠實標示「本篇不可複驗」,比製造假精確好。
分歧二
一方
主張要。沒有硬體證明的覆核不計次數。
另一方
明確反對。理由:支援的硬體太少,等於把覆核者全趕走。
裁決
不要。
決定一的「變化題」已經解決了「你到底有沒有真的跑」這個問題,再加一道硬體鎖是多餘的,而且會在最脆弱的初期把人擋在門外。
分歧三
一方
主張新帳號權重為零,信譽只能由老帳號往下傳。
裁決
否決。
這正是維基百科 2006 年之後犯的錯——為了擋爛人,把新人一起擋掉,活躍編輯數從此再沒回到高點。改採:新帳號 14 天內不計排行榜分數,加上註冊要有一點不可免費複製的成本。
分歧四
我原本的主張
全部由平台隨機指派,像陪審團。
其中一方
提出雙軌制:自選的可以加驗證次數,但只有指派的才計排行榜分數。
裁決
採用對方的方案,我改口。
全部指派會讓冷門題目沒人想碰,雙軌制保留了志願者的熱情,又擋住了刷分。
強訊號
五方在互不通氣的情況下,各自想出了同一個防作弊機制:作者事先封存答案、覆核者拿到不同的題目。
用詞不同——有人叫保留輸入、有人叫擾動任務、有人叫狀態探針——骨架完全一樣。
我檢查過我的提問裡沒有暗示這個方向,所以這是真收斂,不是被我框出來的。這一條可以當成設計的地基。
誠實揭露
我問各方「大廠真正想買的是什麼?是平台本身、用戶、還是別的東西?」——「還是別的東西」這個問法本身就在引導答案。
所以四方一致回答「大廠買的是資料不是平台」這件事,有可能是我框出來的,不能當成證據看待。這一點必須用其他方式重新驗證。
未收斂
原樣呈報,不抹平。
一
各方都指向同一個答案(賣「已驗證研究+完整執行軌跡」的資料給模型實驗室),但每一方都自己標註這是猜測,沒有任何一方能提出已經發生的實例。
二
其中一方的原話大意是:那八個前輩不是死在規則設計爛,是死在沒人來。這句話如果是對的,那前面所有機制設計都還沒碰到真正的問題。
三
整套設計的地基是「複驗成本夠低」。如果一份研究要跑三天才驗得完,隨機指派+兩份獨立覆核就不可行。這是未經檢驗的關鍵假設。
下一步