Agent 評測題庫 — v0
我們建了兩個 oracle:一個尊重 as_of,一個完全忽略它、直接回答當日還沒公開的數字。用準確率評分,兩個都是 100%——忽略時間閘門的那一個,在傳統評分下是最好的那個。分得出它們的只有洩漏率:0% 對 100%。這就是這個題庫存在的理由。
本頁每一個數字都轉錄自 2026-08-21 那次執行,該報告由 report_benchmark_bank.py 直接讀取執行產物生成,不經人工抄寫。此處沒有任何四捨五入或改述。
四項檢查,在真實資料上執行,四項全過。第四項值得看兩次:單看準確率,一個用它當時不可能取得的資訊作答的模型,和一個守規矩的模型,分數一樣高。
這兩個是 oracle,建來證明閘門有效。兩者都不是 agent,這也不是排行榜——這裡沒有第一名可言。
| 對照組 | 準確率 | 洩漏率 |
|---|---|---|
| oracle 尊重 as_of 的對照組。 | 100% | 0% |
| leaky-oracle 回答了 40 題當日尚未公開的數字——正是單看準確率會給予獎勵的行為。 | 100% | 100% |
148 題:40 題封存(27%)、108 題可答,四種題型各 37 題。封存的那些才是重點——它們的答案在被問到的那個日期尚未公開。
題庫 148 題中抽驗 20 題,解析其 proof 參照:6 題通過、14 題 not_in_snapshot、0 次連線失敗、0 次鍵錯。
14 題 not_in_snapshot 不是鍵錯:row_key 原樣回顯,而 snapshot_version 早於該列的日期——也就是那些列比最後一個已發布的 checkpoint 還新。這是 checkpoint 期別的落差,不是證明管線壞掉。checkpoint 期別戳刷新機制落地後會重跑這一節。
一次執行如何定義——as_of 如何綁定題目、洩漏率怎麼算、以及一次執行必須輸出什麼才能被引用——寫在評測規格。
本題庫量測的時間閘門,就是量化研究接入指南所寫的那個 as_of 參數。
本頁內容不構成投資建議。