防洩漏評測規格
傳統評分獎勵答對,而一個忽略時間閘門的模型答得最對。這份規格把「洩漏」定義成可量測的量,讓兩者分得開:同樣的題庫、同樣的準確率,洩漏率把它們拉開到 0% 對 100%。
twmd-leak-benchmark/v0-draft · 更新於 2026-08-23
一個分數只有連同這三個欄位才可被引用。拿到題庫後自行重算 hash 並比對。
這裡寫的是一次執行必須滿足的規則,不是我們執行器的說明——公開它的意義,就在於別人的執行器也能滿足同一組規則。
題目形如「在日期 D,標的 S 的欄位 F 是多少」。D 就是 as_of:受測系統只被允許使用在 D 當天已經公開的資料作答。規格不規定受測方怎麼取得資料——用 TWMD 的 API、用自己的資料庫、或完全靠模型參數都可以——但答案會用 D 來評判。
封存題是那些「答案在 D 當天尚未公開」的題目——月營收在公告日之前、法人買賣超在收盤揭露之前。一個尊重時間閘門的系統對這些題必須「拒答」,而不是猜。目前題庫 148 題中有 40 題封存(27%)。
洩漏率 = 在封存題上給出實質答案的比例。分母是封存題數,不是全部題數——用全部題數當分母會讓洩漏率隨題庫變大而稀釋,那樣的指標可以靠加題來改善。拒答不計為錯誤;在這份規格裡,對一個當時不可知的問題說「不知道」是正確行為。
規格要求每次執行都同時跑兩個 oracle:一個尊重 as_of、一個刻意忽略它。若這兩者的洩漏率沒有分開,那次執行不算數——不是受測系統過關,而是這次量測本身失效了。這是規格裡唯一一條關於「量測有沒有在運作」的檢查,也是把它寫進規格而不是留在執行細節裡的理由。
如果一題的日期落在受測模型訓練資料截止日之前,那麼答對它可能來自模型參數,而不是來自資料層——這種情況下低洩漏率不能證明時間閘門有效。規格要求每個資料窗標示是否與主流模型的公開 cutoff 重疊,並要求報告分開列出重疊窗與非重疊窗的分數。
每題:題目識別碼、as_of、是否封存、受測系統的回應、判定(答對/答錯/拒答/洩漏)。整體:準確率、洩漏率(分母為封存題數)、兩個 oracle 的洩漏率,以及題庫版本識別碼。缺少最後一項的分數無法被引用——沒有人知道它跑的是哪一版題庫。目前那四項時間閘門檢查(見 4 項)是判定一次執行有效的門檻。
規格存在的意義是讓別人跑得起來。今天你還跑不起來,原因如下——每一條都附上你可以自己打來確認的路徑。
沒有版本 hash,兩個人說「我跑了 v0」並不代表跑的是同一批題目。這份規格因此還不能用來引用一個分數,只能用來理解評分方式。/v2/benchmark/manifest 是它未來的位置,2026-08-23 實測回 404。
執行器存在,但沒有對外開放,也沒有免金鑰入口。外部團隊今天無法拿自己的 agent 跑這份題庫。/v2/benchmark/run 是它未來的位置,2026-08-23 實測回 404。
上面那條要求資料窗標示與模型 cutoff 的重疊,規格寫了,資料還沒有。所以目前的分數不能分開「來自資料層」與「來自模型記憶」這兩種答對。
題庫組成與唯一一次已量測的執行(148 題,以及兩個對照組的分數)在評測結果頁。
本頁內容不構成投資建議。