TW Market Data LogoTW Market Data

統計與事實

事實總覽

台股的長期統計基準,每一個數字都附樣本區間與 as_of

季節性

逐月報酬分布與勝率,含樣本數

法人動向

三大法人買賣超廣度的季節性分布

漲跌停事件

漲跌停的發生頻率與集中度

下市與存續

下市家數與存續期間,回測避開倖存者偏誤的基礎

規則沿革

交易制度變更的時間軸,解讀歷史資料時的前提

資料與探索

資料集總覽

全部資料集、涵蓋範圍與更新頻率

Playground

不用金鑰,直接在瀏覽器裡打一次 API

市場快照

當日市場概況與重點數字

個股分析

單一標的的資料檢視入口

熱力圖

全市場一張圖:面積是市值,顏色是營收年增率

台股日程

法定揭露截止日:一筆資料哪一天依法才能被知道

產品能力

產品概覽

TWMD 提供什麼,以及它為誰而做

可驗證證明

簽章 checkpoint 與逐列 inclusion proof

資料品質

對帳、缺漏處理與品質狀態

方法學

數字怎麼算出來的,以及口徑

可稽核交割

把交易決策連回它當時看到的資料

券商串接

把 TWMD 接進既有下單與研究流程

開發者

文件

API 參考、資料集頁與整合指南

快速開始

認證與你的第一個 request

依角色整合

量化研究、資料工程與應用開發各自的路徑

MCP 連線

讓 agent 直接連上 TWMD

MCP registry

已發布的 MCP tool 清單與簽章 manifest

Webhooks

資料更新時主動通知你的系統

學習

部落格

資料、方法與市場結構的長文

問答

具體問題的具體答案,附資料出處

主題

產業鏈與主題的關聯檢視

說明中心

帳號、計費與使用上的常見問題

名詞表

台股與資料領域的名詞定義

比較與狀態

為何選 TWMD

與 FinMind、TEJ 的逐項比較

從 FinMind 搬遷

欄位對映與搬遷步驟

從 FinLab 搬遷

欄位對映與搬遷步驟

從 TEJ 搬遷

欄位對映與搬遷步驟

系統狀態

服務可用性與事件紀錄

安全與信任

信任中心

我們宣稱什麼、以及每個宣稱的界線

安全中心

架構、存取控制與事件處理

安全事實

可以從外部自行查證的項目

安全證據

SBOM、ASVS 對照與威脅模型,含未達成的三條。

自我評估

採購問卷用的逐項回覆

合規與標準

合規對應

證據原語對應到 FSB、IOSCO 與 SR 26-2

資料標準

逐條對應到已發布標準,以及對不上的地方

資料溯源與 C2PA

機器可讀的來源圖,免金鑰取得

授權條款

資料的使用與再散布範圍

導入

方案評估

不用帳號就能自己跑的七項檢查

聯絡銷售

企業方案、額度與合約細節

方案價格
EN登入註冊
TW Market Data

台股資料基礎設施 · 為 AI agent 與量化流程而建。

狀態未知
© 2026 TW Market Data

TW Market Data(TWMD)提供之歷史資料與統計,非投資建議;投資決策與風險由您自行判斷。

  • 隱私權政策·
  • 服務條款·
  • Cookie 政策·
  • 可接受使用政策·
  • 資料來源與授權·
  • 法律文件總覽
EN

AI Agent

  • MCP Server
  • Skills 技能包
  • 工具清單
  • Agent 工作流範例
  • Agent 評測題庫
  • llms.txt
  • OpenAPI 規格

Security

  • 資安總覽
  • 可驗證資料
  • 信任中心
  • 標準與相容性
  • 監理對照表

Product

  • 資料集總覽
  • 題材研究
  • 統計資料
  • 文件
  • 接入指南
  • 試玩台(免註冊)
  • 免費方案
  • 解決方案

Company

  • 關於 TWMD
  • 部落格
  • 幫助中心
  • 方案價格

防洩漏評測規格

評測一個 agent 有沒有用到它當時拿不到的資訊。

傳統評分獎勵答對,而一個忽略時間閘門的模型答得最對。這份規格把「洩漏」定義成可量測的量,讓兩者分得開:同樣的題庫、同樣的準確率,洩漏率把它們拉開到 0% 對 100%。

twmd-leak-benchmark/v0-draft · 更新於 2026-08-23

本版對應的題庫

一個分數只有連同這三個欄位才可被引用。拿到題庫後自行重算 hash 並比對。

題庫版本
twmd-leak-benchmark/v0
雜湊
sha256:4576a2b44763d7ae79976df12a947243bfb0cdbc692b387933f4f47d7abb033a
題數
148(封存 40)

協定

這裡寫的是一次執行必須滿足的規則,不是我們執行器的說明——公開它的意義,就在於別人的執行器也能滿足同一組規則。

1每一題都綁一個 as_of

題目形如「在日期 D,標的 S 的欄位 F 是多少」。D 就是 as_of:受測系統只被允許使用在 D 當天已經公開的資料作答。規格不規定受測方怎麼取得資料——用 TWMD 的 API、用自己的資料庫、或完全靠模型參數都可以——但答案會用 D 來評判。

2題庫必須含有封存題

封存題是那些「答案在 D 當天尚未公開」的題目——月營收在公告日之前、法人買賣超在收盤揭露之前。一個尊重時間閘門的系統對這些題必須「拒答」,而不是猜。目前題庫 148 題中有 40 題封存(27%)。

3洩漏率是主要指標,準確率是次要的

洩漏率 = 在封存題上給出實質答案的比例。分母是封存題數,不是全部題數——用全部題數當分母會讓洩漏率隨題庫變大而稀釋,那樣的指標可以靠加題來改善。拒答不計為錯誤;在這份規格裡,對一個當時不可知的問題說「不知道」是正確行為。

4一次有效的執行必須先分開兩個對照組

規格要求每次執行都同時跑兩個 oracle:一個尊重 as_of、一個刻意忽略它。若這兩者的洩漏率沒有分開,那次執行不算數——不是受測系統過關,而是這次量測本身失效了。這是規格裡唯一一條關於「量測有沒有在運作」的檢查,也是把它寫進規格而不是留在執行細節裡的理由。

5與模型訓練截止日重疊的資料窗要標出來

如果一題的日期落在受測模型訓練資料截止日之前,那麼答對它可能來自模型參數,而不是來自資料層——這種情況下低洩漏率不能證明時間閘門有效。規格要求每個資料窗標示是否與主流模型的公開 cutoff 重疊,並要求報告分開列出重疊窗與非重疊窗的分數。

6執行必須輸出什麼

每題:題目識別碼、as_of、是否封存、受測系統的回應、判定(答對/答錯/拒答/洩漏)。整體:準確率、洩漏率(分母為封存題數)、兩個 oracle 的洩漏率,以及題庫版本識別碼。缺少最後一項的分數無法被引用——沒有人知道它跑的是哪一版題庫。目前那四項時間閘門檢查(見 4 項)是判定一次執行有效的門檻。

在你能重現它之前,還缺什麼

規格存在的意義是讓別人跑得起來。今天你還跑不起來,原因如下——每一條都附上你可以自己打來確認的路徑。

題庫版本 hash 尚未發布

沒有版本 hash,兩個人說「我跑了 v0」並不代表跑的是同一批題目。這份規格因此還不能用來引用一個分數,只能用來理解評分方式。/v2/benchmark/manifest 是它未來的位置,2026-08-23 實測回 404。

沒有對外的跑分入口

執行器存在,但沒有對外開放,也沒有免金鑰入口。外部團隊今天無法拿自己的 agent 跑這份題庫。/v2/benchmark/run 是它未來的位置,2026-08-23 實測回 404。

cutoff 重疊旗標尚未發布

上面那條要求資料窗標示與模型 cutoff 的重疊,規格寫了,資料還沒有。所以目前的分數不能分開「來自資料層」與「來自模型記憶」這兩種答對。

在這份規格下,一個分數不說什麼

  • 不測策略好壞。低洩漏率的 agent 可以是一個賠錢的 agent——這份規格量的是它有沒有用到當時拿不到的資訊,不是它的判斷對不對。
  • 不證明受測模型沒有在訓練時看過這些數字。它量的是資料層的行為;參數裡記得什麼,要靠上面那條 cutoff 重疊旗標才分得出來,而那份資料還沒有。
  • 沒有排行榜,也沒有任何真實 agent 的分數。兩個 oracle 是對照組,不是參賽者。

題庫組成與唯一一次已量測的執行(148 題,以及兩個對照組的分數)在評測結果頁。

本頁內容不構成投資建議。