Skip to main content
AI Forecasts 面板(内部 id forecast)展示 WorldMonitor 预测管道产出的预测。每条预测是一个结构化的预言,包含概率、领域分类、时间范围和支持信号;面板提供两个筛选维度(领域和宏观区域),让你聚焦于关心的切片。

如何解读一条预测

  • 百分比 表示预测事件在其时间范围内发生的概率。它由固定的信号规则设定,并可能与匹配的预测市场价格混合。没有任何 LLM 选择这个数值。对于状态派生的市场和供应链预测,规则的一项输入来自从新闻中提取信号的 LLM(issue #4963)。LLM 还负责撰写情景与案例文本。
  • 每条预测都会被核验。 预测随判定它的规则一同发布。如果规则在预测仍待结算时被修正,原规则会保留在记录中。截止时间过后,结算器将其标记为 YES、NO 或 VOID,并保留证据。
  • VOID 表示该预测无法被公平核验,例如判定它的数据源无法读取,或证据无法回答该问题。VOID 既不算命中也不算失误。VOID 的占比与分数一同公布。
  • 历史成绩 见 /accuracy/。自 2026-10-07 起,该记录处于审计状态,分数已撤回,直到记录包含至少 30 个预测族,其中至少 5 个成真、5 个未成真。一个预测族就是一个预测 id,因此在多次运行中出现的同一预测只计一次。当一份新鲜的成绩单达到该下限时,审计无需修改代码即会解除,/accuracy/ 会在下一次每周刷新时跟进。在此之前没有经过测量的预测能力,因此请把百分比理解为信号规则的估计,而非已被证实的概率。
  • 空的筛选项。 在出现能够判定网络预测的核验方式之前,网络预测暂停发布。政治预测迄今只来自预测市场,而预测市场预测因同样原因暂停发布,因此 Political 筛选项通常为空。自 issue #5334 以来没有检测器产出基础设施预测,因此 Infra 筛选项为空。见下文“结算与成绩单”。

面板显示内容

一个活动预测列表,通过两行标签筛选:

领域筛选

All / Conflict / Market / Supply Chain / Political / Military / Cyber / Infra 网络预测和预测市场预测暂停发布期间,Cyber 和 Political 筛选项下可能没有预测(见下文“结算与成绩单”)。已发布的政治预测全部来自预测市场,因此在政治预测有可校验的问题之前,Political 筛选项一直为空。

区域筛选

All Regions / MENA / East Asia / Europe / South Asia / Africa / LatAm / N. America 区域无法归类(未知或 global)的预测仅出现在 All Regions 下。面板的最低概率阈值为 0.1(10%)— 低于该阈值的预测不在面板视图中显示。 每条预测行显示预测文本、事件概率、领域(颜色编码)、时间范围和精简的来源溯源链。深度模拟路径置信度单独显示为置信度,而非事件概率。

校准与投射说明

预测概率来自 scripts/seed-forecasts.mjs 中确定性的、基于规则的信号检测器,并在存在匹配的市场锚点时可选地与预测市场混合。LLM 调用不设定数值概率。它们在已评分的预测周围生成叙事场景、案例文件、分支和视角文本。种子器中的默认路由为 OpenRouter deepseek/deepseek-v4-flash(主,推理已禁用)、然后是固定的免费 OpenRouter 回退 google/gemma-4-26b-a4b-it:free 和 nvidia/nemotron-3-super-120b-a12b:free。一个被跟踪的例外:关键信号提取阶段向状态派生(市场/供应链)预测的确定性评分贡献信号强度/置信度,因此该阶段固定使用 OpenRouter google/gemini-2.5-flash(见 issue #4963)。 仅当种子器能将预测匹配到预测市场锚点时,预测概率才经过市场校准。在那些情况下,calibration 对象包含市场标题、市场价格、漂移和来源,显示的概率与该市场锚点混合。calibration: null 的预测是源自 WorldMonitor 信号规则的内部/旧有估计,而非外部市场校准的概率。 当基于历史结果拟合的校准映射通过其激活门槛时,种子器会发布经该映射校准后的概率。保序回归拟合时,每个预测家族的总权重相同;激活门槛按家族计数:前向队列需有至少 60 个不同预测家族的已结算结果,每个启用映射的领域至少 30 个家族,校准减原始 Brier 差值的配对 95% 区间由按家族整体重采样的自助法给出,其上界须不超过 0.005(issue #9034)。门槛不再通过、映射缺失、门槛结论超过 48 小时,或设置了 FORECAST_CALIBRATION_FORCE_RAW=1 时,则发布原始概率。公开 API 不标注某个概率是否经过校准。记分卡按窗口打开时发布的概率为每个窗口评分,因此在原始与校准发布模式切换之后,滚动窗口的 Brier 分数会同时包含两种模式下发布的预测。 种子器还为每条预测计算三个预测目标时间范围(24h、7d、30d)的投射。这些数值不是概率,也不对外发布:2026-10-07 之后生成的预测负载(issue #8967)不再包含 projections 字段,因此在首次此类运行替换缓存的预测后,API 和 MCP 不再返回该字段。种子器只在内部预测历史中保留这些数值,供按时间范围评分读取。每个值都来自 scripts/seed-forecasts.mjs(computeProjections)中人工设定的固定领域曲线:先用预测概率除以曲线在锚点时间范围上的乘数,再乘以目标时间范围的乘数,最后钳制到 1% 下限和 95% 上限(0.01 / 0.95)。锚点是该预测自身的预测目标时间范围(timeHorizon);市场预测例外,以曲线中的最强乘数为锚点,因此 30 天的市场发射不会夸大 24 小时的数值。若某条预测自身的结算规格是时点型硬性契约(at-deadline,目前为供应链咽喉要道族和 GPS 干扰族),其除自身预测目标时间范围之外的每个投射值都会在结果账本中获得各自的结算窗口,键为 <id>@<deadline>@<horizon>,概率冻结为首次发射时的值,并从该时间范围截止点前后、存储容差(一个结算器周期,且不超过该时间范围的一半)以内最近的数据源样本读取。结算种子器在存储的记分卡中以独立的 projections 区块按时间范围报告这些窗口,绝不并入头条指标。每个时间范围行统计已登记、已到期、已评分、UNOBSERVED 和 VOID 窗口数,以及已评分窗口背后的预测族数量,并给出带 95% Wilson 区间的 YES 实现率。Wilson 区间把每个窗口视为相互独立,而一条预测可以持有多个窗口,因此应结合预测族数量来解读。Brier 分数在某个时间范围达到最小样本量之前不予报告。同样的行还按领域(byDomain)和投射曲线版本(byCurvesVersion)分别列出。时间范围窗口只保留父预测的领域、区域、标题、来源和状态分桶。父预测的校准、未校准概率、基础概率、概率来源、集成轮次和市场 slug 描述的是父预测的概率,因此窗口不复制这些字段;对此规则之前登记的窗口,结算器每次运行都会将其从实时账本中移除;已归档的回执保持不变。其余投射值(判定型、区间内型或以结算日期为准的规格)均标记为未评分并注明原因。每条已发布预测的 scoredHorizons 字段列出已登记评分窗口的时间范围。投射值和评分窗口不对外发布。按时间范围的评分按下文所述的最低样本规则发布。 面板在预测标题下方的“同时评分于”行中列出 scoredHorizons 所含的时间范围。头条概率按预测自身的时间范围评分,因此该行只列出额外的时间范围。面板不显示投射值,叙事提示词也不接收投射值。提示词仍包含预测概率,而锚点时间范围的投射值可能与之相等,因此情景或案卷文本中出现相同的百分比,并不表示使用了投射值。时点型按时间范围评分已在 issue #7075 中交付。判定型和累积型时间范围在 issue #8969 中跟踪。 记分卡还会写出一个公开的 horizonGrades 区块(issue #9057)。它按投射曲线版本和时间范围各列一行,取自 byCurvesVersion 切片,因此一个评分不会混合不同的曲线版本。只有当某行的已评分窗口达到头条的预测族最低要求时,该行才给出带预测族自助法 95% 区间的 Brier 分数,以及带 95% Wilson 区间的实际 YES 比例。最低要求是:至少 30 个预测族,其中至少 5 个为 YES、至少 5 个为 NO。记分卡和 /accuracy/ 都通过 scripts/_forecast-scorecard.mjs 中的 meetsFamilyOutcomeMinimums 执行这条规则,它也是头条使用的判定。未达最低要求时,该行只给出窗口数和预测族数,并标记 measurable: false,/accuracy/ 在这些计数旁显示“Not yet measurable”(尚不可衡量)。没有版本标记的窗口计入 unversionedScored,从不评分。投射不是概率,因此每个评分都把投射值当作概率来打分;/accuracy/ 会说明这一点,并在每个评分旁写出曲线版本。MCP 工具 get_forecast_scorecard 提供该区块。REST 端点不提供,因为公开的 OpenAPI 文档在其大小上限内已没有余量。每周的 /accuracy/ 冻结任务使用服务密钥,在规范 MCP 主机(https://worldmonitor.app/mcp;www 别名返回 410)上通过 MCP 工具读取该区块。读取失败时,若存在同一评分运行的较早读取结果,冻结任务会保留它,并输出警告。页面及其 scorecard.json 下载只在该区块的 generatedAt 与 REST 记分卡的相同时才使用它。MCP 工具和页面都会根据每行的计数重新检查最低要求,而不是直接采信 measurable。准确性审计进行期间,页面与其他分数一样不显示这些评分,下载文件保留这些行并标注为审计中。 GET /api/forecast/v1/get-forecasts 响应包含 degraded、stale 和 error 字段,以便客户端区分后端/缓存中断与健康的空预测集。 面板 id 为 forecast;规范组件为 src/components/ForecastPanel.ts。

如何访问

  • Cmd+K:输入 forecast、ai forecast 或 predictions ai。命令面板标签为 “AI Forecasts”,尽管内部面板 id 为 forecast。
  • 按变体的可用性:仅在 full/geopolitical 变体中注册并默认启用。在 tech、finance、commodity 或 happy 变体中不存在。来源:src/config/panels.ts 中的 FULL_PANELS。

数据来源

主要 RPC:GET /api/forecast/v1/get-forecasts。面板还消费相邻 RPC 以支持更丰富的深度模拟界面:
  • GET /api/forecast/v1/get-simulation-package — 最近的模拟输入包。
  • GET /api/forecast/v1/get-simulation-outcome — 最近的模拟结果。
  • POST /api/forecast/v1/trigger-simulation — 在缓存的 cron 输出之外启动一次新的模拟运行。
预测管道作为 Railway cron 运行,拉取最近的冲突、情报、市场和供应链信号,通过预测模型运行,并将聚合结果写入 Redis 中的 forecast:predictions:v2。宏观区域分类来自 shared/forecast-macro-regions.js。

评分与校准

已发布的预测在到达面板之前会被封顶和去重: 当一条预测可匹配到地缘政治预测市场时,种子器记录市场标题、市场价格、相对内部概率的漂移以及市场来源。最终概率随后混合为 0.4 * market_probability + 0.6 * internal_probability。市场标题必须提及预测本身的主题,主题词表与评审解析器共用(scripts/shared/judged-subject-terms.json,由 scripts/_forecast-subject.mjs 加载):国家匹配其名称、国民称谓和地名;地区只匹配其自身词语(如红海的“Bab el-Mandeb”、波斯湾的“Hormuz”、北欧的“Baltic”)以及标签中点名的成员国(如“Israel/Gaza”“Iran Theater”);只涉及单个中东国家的市场问的问题比中东预测更窄,因此不做锚定,而评审解析器仍把任一成员国的新闻视为该地区的证据。军事预测描述的是观测到的兵力态势或空运、空中活动激增,没有市场为其定价,因此不做市场锚定。词语按整词匹配,“Jordan”“Georgia”这类同时是常用词的名称只有在出现相关共现词时才计入。直接复制自预测市场的预测(带有 prediction_market 信号)不做市场锚定(issue #9010)。 市场分桶场景校准是 scripts/seed-forecasts.mjs 中的一个编辑校准层,而非学习到的市场模型。它偏置市场上下文模拟状态如何贡献到预测压力和置信度,使得直接的能源/运费传导获得更多抬升,宽泛的宏观分桶保持适度,而国防重新定价除非证据充分否则被抑制。 冲突和 UCDP 冲突区行是基线检测器上限。UCDP 冲突区计数从 10 事件发布门槛开始,基线概率为 0.35,并在 100 事件时升至 0.85 基线上限。当匹配的 EMA 风险评分具有 velocitySpike 时,种子器在基线上限之后添加 +0.08 概率覆盖,并将结果钳制到 0.99。 国防状态校准在表格之外有额外的直接确认项:每单位直接 defense_repricing 确认添加 +0.12 压力和 +0.08 置信度。当该直接国防确认缺失时,压力减去表格驱动的 dampener(0.12),置信度减去单独的 0.04 缺失惩罚。 未评分的时间范围投射通过以下人工设定的领域曲线扩展到 24h、7d 和 30d。这些乘数是编辑性先验,而非拟合值。市场投射使用曲线的峰值乘数作为锚点;其他领域使用预测发射的时间范围: 曲线、锚点规则、下限和上限共同带有一个版本号 PROJECTION_CURVES_VERSION(当前为 1)。每条带投射的预测及其登记的每个时间范围窗口都标记该版本,记分卡按版本分别报告,因此日后的曲线变更不会与旧曲线的结果混在一起。若窗口由不带版本标记的历史发布登记,则没有版本号,单独成为一个切片(curvesVersion: null)。这包括标记上线之前登记的窗口,也包括上线之后由缺少标记的较早历史发布登记的窗口。从 2026-10-06 开始按时间范围评分到加上该标记期间,曲线没有变化。 趋势被序列化为字符串,而非枚举。当前值为 rising、falling 和 stable,基于相对前一个预测快照的 +/- 0.05 概率 delta。

影子 Bet Engine 评估通道

World Monitor 还会在 forecast:bets:history:v1 运行一个仅影子评估的预测通道。它从不写入 forecast:predictions:v2,因此这些 bet 不会出现在 AI Forecasts 面板。其目的,是先用真实结算结果衡量候选生成方法,再决定是否允许它们进入用户可见的预测流。 该通道现已包含一个专门的地缘政治预测市场家族:
  • 选择结算时间在 2–210 天后的高流动性地缘政治市场;通用市场家族继续保留较短的 2–45 天窗口。
  • 两个家族按市场 slug 构成互斥分区,因此同一个交易场所市场不会生成两份 bet。
  • 地缘政治候选在可选 ensemble 阶段中优先排序,但尝试预算仍为更快结算的能源、大宗商品、通用市场与宏观家族保留空间。
  • 身份与结算使用交易场所 slug,而不是可能变化的标题。硬结算规范在市场截止时间读取结算 feed,并判断 YES 价格是否越过 50%。
  • Polymarket 的一个事件可以在同一 slug 下先后列出多个市场。其中一个市场关闭后,bootstrap feed 会带出该事件的下一个市场,它有自己的标题和截止日期。市场 bet 的 ID 就是 slug,因此结算器还会按市场标题为市场结算窗口建键。同一 slug 的下一个市场是独立的问题:它打开自己的窗口,既不会并入前一个市场的窗口,也不会移动其截止时间。同一市场的发布会并入其窗口,待结窗口正是靠它的截止日期跟随交易场所的关闭时间。
  • 结算加载器按 slug 和标题为每个市场记录一条结果,窗口只读取市场标题与其问题相符的记录,同一 slug 下另一个市场的记录永远不会为它评分。标题比较前统一大小写、空白、弯引号和末尾的 ?;年份不同即为不同市场。bootstrap feed 不带市场 ID,因此超出上述范围的 Polymarket 改标题会被视为新市场:之后的 bet 打开自己的窗口,第一个窗口保留其最后的截止时间。Kalshi 的 ticker 只对应一个市场,因此 Kalshi bet 不做标题检查。
  • 结果始终带有 generationOrigin: "bet_engine",使成绩单能够将该通道与规范预测生成器比较,而不是混合两类记录。
每条影子 bet 都会保留其经验基线或薄历史先验 baselineProbability。只有显式启用 FORECAST_BETS_ENSEMBLE=1 时,受预算约束的三轮 LLM ensemble 才可能替换最高优先级新尝试的工作概率,同时继续保留基线以进行 Brier 分数比较。Ensemble 默认关闭;部分完成会标记为 ensemble_partial,之后仍可升级,不会被当作完整 ensemble。因落在前 K 名或预算之外、或 ensemble 调用失败而保留基础概率的 bet 带有 probabilitySource: 'base_rate'。该基础概率只是占位值,不是预测,因此这条 bet 不会打开账本窗口,也永远不会评分。它的问题保持未结,之后的运行可以为它运行 ensemble,窗口按那次运行的概率打开。Ensemble 关闭时,该通道不评分任何 bet。 这种隔离是有意设计:预测市场流动性是有用的校准证据,但如果在积累结算历史之前就把新家族直接发布到面板,会把“实现完成”误当成“预测能力已得到证明”。

结算规范

每条已发布的预测都带有一个结算规范 — 一份机器可校验的合约,定义在结算时点“应验”的含义。该规范要么是 hard(可通过比较检测器评分所用的同一 WorldMonitor 源中的一个指标来自动结算),要么是 judged(留给后续 LLM 裁判的一个结算问题,仍有硬性截止日期)。截止日期始终存在,以纪元毫秒编码:发射时间加上预测所声明的时间范围 — 预测市场预测除外,后者在市场自身有结束日期时按市场结束日期结算。 硬性规范适用于具有干净指标支撑的预测:
  • 冲突:预测区域内的 UCDP 冲突事件计数。
  • UCDP 区域:UCDP 冲突区事件计数。
  • 市场:自发射时基线衡量的商品期货价格变动。
  • 预测市场:规范仍记录市场结束日期,但结算器会以原因 market_price_not_outcome 将其封存为 VOID。其数据源 prediction:markets-bootstrap:v1 只列出未结束的市场,并把 yesPrice 截在 10 到 90 之间,因此在结束日期读到的是市场价格,而不是结算结果(issue #5233)。这类预测已不再发布(issue #8990)。
  • 供应链:截止时读数中的咽喉要道中断评分。常备威胁分低于数据源红色界限的航线,评分至少为 50 时结算为 YES(CHOKEPOINT_DISRUPTED_MIN_SCORE,即 scoreToStatus 称为红色的界限)。供应链检测器在该界限发出预测,规范以 rule: disrupted 及 ruleVersion 记录。状态派生的运费预测在任意评分上附着同一合约,取其所在海域中断最严重的咽喉要道。霍尔木兹和刻赤的固定战争区基分为 70,已经是红色,读数不可能降到 50 以下。它们的合约是评分高于该基分(rule: above_fixed_base)。待结算行在结算前迁移到当前合约,并以 supersededThreshold 保留早先阈值。已结算的行保留其判定时的阈值(issue #8990、#9033)。
  • GPS 干扰:截止日当天或之后日期的 gpsjam.org 快照中,航运区域框内的六边形数量。区域内仍有至少 3 个六边形时结算为 YES,这与检测器发出该预测的门槛相同。检测器只在区域内不超过 9 个六边形时发出预测,概率为 0.58。在 120 天的快照中,处于该范围的区域在第 7 天快照中仍达到门槛的窗口为 55 个中的 32 个;而东地中海、波斯湾、黑海和波罗的海从未少于 28 个六边形,也从未降到门槛,因此这些区域的预测不可能结算为 NO(issue #9012)。规范以 rule: persistence 及 ruleVersion 记录这一规则。按早先发射时计数阈值写入的待结算行会在结算前迁移到此规则,并以 supersededThreshold 保留旧值(issue #8990)。
  • 基础设施(仅限旧行):已退役的 infra:outages:v1 数据源上的中断事件。自 issue #5334 以来没有检测器产出基础设施预测,新的基础设施规格会走裁判通道。
裁判规范适用于信号到结果映射为编辑性或复合性的领域的预测:
  • 政治:政权稳定、谈判、政策转向。
  • 军事:姿态转换、部署模式。
  • 网络:归因和影响严重性。网络预测已不再发布(issue #8990)。
  • 发布时其分桶没有数据源指标的状态派生预测。能源预测按 CL=F 价格结算,供应链运费预测按咽喉要道评分结算。
  • 硬性族中无法导出有限阈值的预测,尽管其领域如此(例如,没有可交易锚点的市场预测)。
结算规范不改变哪些预测被发布或其顺序 — 它只为每条预测添加机器可校验的基准事实,这是未来公开成绩单的基底,用于对照实际发生的情况为预测评分。

发布时提取门控

每次小时运行都会对每条已发布的硬性规范试运行结算器的提取器,读取的是结算器将来读取的同一份按结算器方式整形的数据源(issue #7067)。运行会按结果、族和领域记录 [ExtractionGate] shadow 计数,并为每条无法提取指标的规范记录一行 would_downgrade。计数行注明部署版本,因此规范变更(#9003 和 #9047 中的 GPS 干扰变更)前后的计数可以分开读取。在影子模式下,门控不改变任何规范。 强制执行处于关闭状态。开关是 scripts/_forecast-resolution.mjs 中的常量 EXTRACTION_GATE_ENFORCED。只有在 #7067 上发布了 7 次每日运行的影子队列,且裁判通道在 7 次运行中保持低于 20 条待裁判条目且没有增长之后,才会通过经过审查的变更将其打开。打开后:
  • 每条已发布的规范都记录 specOrigin:hard、judged 或 hard_downgraded_unextractable。硬性规范还以 specFamily 记录其分派族。账本行会复制 specOrigin。没有该字段的行属于遗留行。
  • 无法提取指标的硬性规范会变为裁判规范,specOrigin 为 hard_downgraded_unextractable。它保留 originalFamily、originalMetricKey、originalSourceFeed 和 downgradeReason,其硬性时间范围合约变为不计分(parent_unextractable)。只有当存储的成绩单不超过 48 小时(EXTRACTION_GATE_SCORECARD_MAX_AGE_MS,与校准门控对同一键的要求相同)、其裁判通道的待裁判条目少于 20 条(EXTRACTION_GATE_MAX_PENDING_JUDGE),且该通道在 SLA 内计分的比例至少占已插桩结算的一半(EXTRACTION_GATE_MIN_SCORED_WITHIN_SLA_RATE,0.5)时,才会降级。低于一半时,降级行更可能以 VOID 或迟到告终而不是按时计分,这只是把硬性路径的失败转移到另一个通道。否则规范保持硬性,运行会记录原因。
  • 硬性规范与其降级在账本中是同一个问题。提取判定随每小时的数据源快照而变,因此同一条预测可能先通过、再失败、又通过。先打开窗口的那种规范保留该窗口,另一种规范的发射计为该窗口的观测。同一条预测的两次降级,只要失败的是同一指标,即使裁判问题中的标题或区域变了,也算同一个问题。被裁判窗口吸收的硬性发射不会注册时间范围窗口。已同时持有两者的账本保留较早的一个,并将另一个以 duplicate_window 作废。
  • 若裁判规范唯一可用的问题是通用模板 Will "<title>" resolve YES(市场、军事和供应链预测),该规范会变为 unscored,原因是 generic_judged_question。结算器不会为不计分规范打开窗口,因此它永远不会进入裁判通道。该规则也适用于降级后的规范,因此降级的 GPS 干扰或咽喉要道预测会被保留在通道之外,直到其领域有专门的问题。
存储的成绩单带有内部的 specOrigins 块,公开端点不提供它。它按来源和硬性族报告条目、已结算、已计分、VOID、待结算、SLA 内计分以及结算延迟中位数。每一行都按裁判通道的时钟衡量(截止时间加 18 小时再加 2 天),因此降级的族与其自身的硬性路径相比较。当行存有 originalFamily 或 specFamily 时,族取自该字段。遗留行的族由其规范读取的确切数据源反推,所有市场输入数据源都计为市场族。已退役的基础设施中断数据源(infra:outages:v1,issue #5334)上的行以及 bet engine 行会单独计数并排除。 被保留的预测仍会发布,但不打开账本窗口,否则它会从记录中消失,并通过删除降低 VOID 率。存储的成绩单中的内部 withheldAtEmission 块按账本计算窗口的方式对其计数:同一 id 的每小时重新发射若落在更早一次已计数发射的时间跨度内,就是同一条预测。每条预测只计一次,按原因以及其失去的硬性族(或其领域)统计,范围是结算器读取的预测历史,其最早快照为 since。

刷新频率

种子器大约每小时运行一次。该键在 api/health.js 中允许最多 90 分钟(maxStaleMin: 90)后健康面才会升级告警。

结算与成绩单

已发布的预测携带机器可校验的结算规范。一个每日结算器将这些规范预注册到 forecast:resolutions:v1,在截止日期前采样硬源指标,然后带着证据将每条已发布预测结算为 YES、NO 或 VOID。派生的 forecast:scorecard:v1 报告 Brier 评分、对数评分、校准分桶、VOID 率、下文所述的评估语料统计和市场锚点技能。裁判规范被跟踪为待处理,留给快速跟进的裁判,并在结算之前从首个硬源成绩单中排除。 VOID 占比的目标是低于已结算已发布预测的 15%(GO_FORWARD_VOID_SHARE_TARGET),只统计 2026-10-08 当天及之后首次发布的窗口(GO_FORWARD_SINCE,issue #4930)。窗口按其 firstSeenAt 归入,没有首次发布时间时按 generatedAt 归入。这一组窗口取自结算台账总计的统计范围,即仅限已发布预测,再限定为上述窗口:影子押注(bet_engine)在晋升之前不计入,因为用户看不到它们;状态派生的能源和货运预测会发布,因此计入。更早的窗口含有 issue #8990 审计中重新标注的 VOID,因此滚动 VOID 率不是该目标的衡量口径。成绩单在 goForward 下报告这一组窗口:条目数、已结算数、VOID 数、带 95% Wilson 区间的 VOID 占比,以及按原因划分的 VOID。公开端点不提供该数据块。方法说明会写出这一占比,/accuracy/ 会在结算台账总计下方显示方法说明;在审计撤回评分期间,则显示在“方法说明”部分。这一组窗口尚无任何结算时,句子会如实说明,而不是显示 0%。已结算预测少于 GO_FORWARD_MIN_RESOLVED(30)条时(与技能评分的预测族门槛相同),句子会写出占比,但不与目标比较。裁判类预测比硬性预测晚几天结算,且历来更常被判为 VOID,因此早期读数偏低。当 2026-10-08 早于 180 天滚动窗口的起点后,在窗口起点之前结算的预测不再计入,句子也会改为注明该窗口。 公开的准确率记录自 2026-10-07 起处于审计状态(issue #8990)。审计生效期间,/accuracy/、其 scorecard.json 下载、llms-full.txt、REST 成绩单的 underAudit 字段、预测面板和 MCP 预测工具都会撤下所有分数,并显示带日期的说明。常设审计(shared/forecast-accuracy-audit.js 中的 STANDING_ACCURACY_AUDIT)会在成绩单报告头条队列可衡量时自动解除:至少 30 个预测家族,其中至少 5 个结果为发生、5 个结果为未发生。解除审计无需修改任何常量。每个界面都对其展示的成绩单调用 forecastAccuracyAudit(),因此同一份成绩单在所有界面上的状态一致。REST 处理器和 MCP 读取种子器写入的 skill.measurable。公开契约没有空间容纳该字段,因此 /accuracy/ 从其冻结快照中技能 Brier 区间的 insufficientSample 标志读取同一结论;种子器用相同的最低要求、在相同的记录上计算这两者。缺失、降级或无法读取的成绩单不可衡量,因此审计保持生效。过期的成绩单即使可衡量也保持审计:REST 响应标记为 stale(种子超过 36 小时)时;MCP 工具在 seed-meta:forecast:scorecard 时钟超过 36 小时或未知时;/accuracy/ 在其快照过期、抓取失败或沿用前一周数据时。每周快照还会保留实时 API 的 underAudit,该标志存在时,无论 /accuracy/ 自身读数如何,审计都保持生效。/accuracy/、scorecard.json 和 llms-full.txt 只有在携带新快照的每周刷新 PR 合并后才会改变状态。未设置覆盖时,面板在成绩单返回之前,既不显示说明,也不显示分数。 如需在头条可衡量时仍保持审计(用于将来的事件),将 FORECAST_ACCURACY_AUDIT_OVERRIDE 设为一个 { since, issue, reason } 记录,并重新构建生成的输出。since 须为日历日期,issue 为正整数,reason 不能为空;其他任何真值都会改为显示常设审计说明。该覆盖只能增加审计。头条不可衡量时,没有任何设置可以解除审计。成绩单的方法说明还会写明,有多少条头条预测是在向 issue #7071 之前的匹配器所选市场价格混合之后发布的。这些记录按发布时的概率评分。方法说明会公布该计数;结构化的 preLineageAnchorCount 字段不出现在 API、MCP 和 /accuracy/ 中。 sovereign_risk、rates_inflation 和 fx_stress 分桶中的状态派生市场预测不再发布,因为没有数据源可以校验它们(issue #5234)。它们此前的记录仍保留在 forecast:resolutions:v1 中,但成绩单报告的所有数字都不计入这些记录,包括 VOID 率。结算器会把其中未结算的记录以原因 withheld_unpublished 封存为 VOID,不调用任何裁判。状态派生的 energy 和 freight 预测仍会发布。发布时若价格或咽喉要道数据源有匹配的数值,就按该数据源结算,否则交由裁判结算。 同一规则还暂停发布另外 2 个无法计分的族(issue #8990)。两者都列在 scripts/seed-forecasts.mjs 的 WITHHELD_PUBLISH_FAMILIES 中:
  • 网络(cyber 领域的所有预测)。在 CYBER_JUDGING_HELD 暂停裁判期间,每条网络记录都会以原因 judged_evidence_unreliable 封存为 VOID。
  • 预测市场(所有带 prediction_market 信号的预测,该信号由预测市场检测器附加)。它们读取 prediction:markets-bootstrap:v1 上的市场价格,每条记录都会以原因 market_price_not_outcome 封存为 VOID。
生成器仍会计算这些预测,并在本次运行的世界状态中使用它们,但发布选择会跳过它们,并在发布遥测中记录原因 withheld_family。选择会用其他领域的预测填满目标数量,目标数量的计算也不包括它们。它们不会进入 forecast:predictions:v2、面板、API 或 MCP,因此结算器不会为它们开新记录。变更前开出的记录照旧结算,并作为 VOID 留在成绩单中,直到离开滚动窗口。要恢复某个族,请在为其提供可校验问题的同一变更中,把它从 WITHHELD_PUBLISH_FAMILIES 中移除。对网络族而言,这一变更是一个新闻存档能够回答的问题,并解除 CYBER_JUDGING_HELD。对预测市场族而言,这一变更是一个按市场 slug 在结算数据源 prediction:markets-resolution:v1 上结算的规范,影子投注已经这样做。 暂停这 2 个族也会去掉政治领域:在 2026-10-08 读取的预测历史中,所有政治预测都来自预测市场。在该历史中,61% 的运行只会发布 3 个领域的预测,没有运行少于这个数。漏斗多样性检查(forecast:funnel:health:v1)仍会统计已发布的领域数和合成占比。暂停期间,其领域下限(scripts/_forecast-funnel.mjs 中的 DEFAULT_MIN_DISTINCT_DOMAINS)为 3,因此这一预期状态不会产生警告。两个族都恢复发布后,下限回到 4。低于下限时生成器会记录警告。它只把结果作为信息记录,从不把健康状态标记为失败,因为健康状态报告的是生成器是否在运行,而不是其输出质量。 在 issue #5233 修复之前,结算器把 cyber:threats-bootstrap:v2 和 infra:outages:v1 当作原始种子信封({_seed, data})读取,在其中找不到任何记录,于是把每一个网络威胁计数和每一个断网存在性检查都记为 0。这些 NO 结果衡量的是读取器,而不是现实世界。结算器现在会在读取任何数据源之前先解开信封,发布时的提取检查也读取同一份解开后的视图。每次运行都会把修复前以这个零读数结算的记录以原因 resolver_envelope_bug 封存为 VOID,把原始结果和证据保留在 supersededOutcome 与 supersededEvidence 中,并在 voidedAt 中记录作废时间。已经更正的记录保持不变,修复后的结算器读到的零值保留其结果。只要作废记录仍在滚动窗口内,成绩单的方法说明就会写明其数量。prediction:markets-bootstrap:v1 上的价格检查也受同一读取器影响,以 no_establishable_metric 封存为 VOID。 解开信封后,网络威胁数据源暴露出第二个问题。只有 AbuseIPDB 和 URLhaus 的记录带有国家,而数据源对每条记录的保留时间都不到一天。因此,每天读取一次的 7 天计数取决于截止时间距离读取时刻有多少小时。同一条判断在截止后 1 小时读到 112 条威胁,在 18 小时读到 0 条。网络预测现在与基础设施和军事预测一样交由裁判判定,每次运行都会把待结算的硬性网络记录转入裁判通道。新闻存档中这类主题的条目很少,因此裁判通道中的网络记录也暂不计分。到期时,结算器以原因 judged_evidence_unreliable 将其封存为 VOID,不调用裁判。#8995 修复裁判证据后仍保留了 CYBER_JUDGING_HELD,因为存档仍很少同时提到网络主题及其国家。在网络问题可以校验之前,网络预测暂停发布(#8990)。校准映射的代码版本已改为 forecast-calibration-pav-v2,因此映射会在排除这些作废记录后重新拟合。 结算器为每个问题保留一个账本窗口。窗口的键为 <id>@<deadline>,覆盖从其 generatedAt 到截止时间之间的发布。市场结算押注的窗口就是该市场本身的问题,覆盖该市场之后的所有发布,因为其截止时间跟随交易平台的收盘日期,市场收盘后可能移到窗口发布时间之前。一个问题由预测 ID 加上它所问的内容构成:地区;对裁判规范而言是问题文本,对硬规范而言是指标、运算符、窗口和方向。押注还把阈值计入问题,因为每次押注运行都会提出新的阈值。检测器每次运行都会根据实时数值重新推导阈值,因此其阈值固定为窗口首次发布时的值。同一 ID 的多个问题截止时间相同时,后出现的问题的键带有 ~<hash> 后缀。网络安全和军事的裁判问题由实时状态生成,因此对这些领域(FROZEN_JUDGED_QUESTION_DOMAINS)而言,一个裁判问题就是预测本身:ID、地区和期限,而不是问题文本(issue #9067)。网络安全问题写明的威胁指标数量在每次运行时都会根据实时计数重新推导,而由硬规范迁移来的网络安全计数使用另一个模板。军事预测每个战区一个,其标题随实时的激增类型(态势、空中活动、空运或战斗机激增)和主要行动国家而变化。窗口保留首次发布时的问题,之后的运行计为该窗口的观测。其他裁判问题仍按问题文本作为键。检测器的标题是其 ID 的一部分;状态派生预测的标题写入其状态单元,而该单元的标签随地区一起变化,地区本身已在键中。修复之前,每出现一个新数量或新标题就会打开另一个窗口。下文的修正会将这些多余窗口封存为 duplicate_window,并保留最早的窗口。 结算器每次运行都会读取最近 200 次预测历史运行和押注历史。落在同一问题已有窗口内的发布会并入该窗口,无论窗口处于什么状态,因此重读历史不会重新打开已结算的窗口。结算器首次看到某次发布时,如果其截止时间已过,就不为它开窗口,因为那样只能用之后的数据来读取该窗口。 每个窗口按其首次发布时的概率(firstSeenProbability)评分,并使用随之发布的校准、来源与集成轮次。同一问题之后的发布只把其概率记录在 lastSeenProbability 中,不改变任何评分。某个押注的问题已有覆盖当前运行的未结窗口时,押注种子器不会再为它运行集成。以基础概率占位值发布的押注(probabilitySource: 'base_rate',或没有 probabilitySource,即早于集成阶段的押注)从不打开窗口,因此每个已评分的押注窗口都以集成概率打开。betEngine 分项与基础概率、市场和偏离的比较只读取这些窗口(ensembleCount)。 在 issue #8990 之前,重读历史会重新打开已经结算的窗口,每个未结窗口都按最后一次出现时的概率评分。每次运行都会在 resolver_envelope_bug 作废之后更正修复前写入的记录。若某窗口的发布落在同一问题更早的窗口内,它就是重复窗口:它及其时间范围窗口以原因 duplicate_window 封存为 VOID,在 duplicateOf 中指明所重复的窗口,并把原状态或原结果及证据保留在 supersededStatus、supersededOutcome 与 supersededEvidence 中。已经是 VOID 的重复窗口保留原因,只增加 duplicateOf。之后的更正可能把重复窗口所指的窗口也作废,或使其所指窗口的时间跨度不再包含它的发布(issue #9067)。此类重复窗口会改为指向覆盖其发布的有效窗口,否则指向链条末端的窗口,并记录 duplicateRepointedAt。重复窗口从来不是一个问题,因此成绩单的任何计数、回执和卡片标记都不包含它。评分概率与首次概率不同的窗口,或旧代码再次看到过的窗口,会恢复为其首次发布的内容,原因为 last_seen_probability,被替换的值移入 rescore。若首次发布仍在历史读取范围内,窗口的来源、基础概率、集成轮次、市场锚点和混合后数值会精确恢复(restoredFromHistory);每个押注窗口的首次发布都在押注历史中。否则按推断处理:之后那次出现的集成轮次、锚点和混合后数值移出,基础概率保留;首次概率等于基础概率时,说明窗口以占位值打开(probabilitySource: 'base_rate',并带有 rescore.inferredBaseRate);集成结果也可能恰好等于基础概率,因此推断出的标记只会让该记录退出技能比较,不会将其作废;概率未变的再次出现保留来源和集成轮次。经首次发布确认无误的记录会写入 openingVerifiedAt,之后的调用不会再把它误当作被覆盖的记录。只有读取了历史的调用才会改评分;结算器每次运行中的第二次读取不传入历史,记录保持原样。每次运行在打开新窗口之后会再次执行更正,因为新窗口可能早于同一问题已有的窗口。改评分的记录没有记录首次概率对应的原始值,因此校准拟合不包含它。已更正的记录保持不变,因此重复运行更正不会再改变任何内容。 在 issue #8995 之前,裁判通道按问题模板中的词语挑选存档条目,且不以截止时间为限。对以这种方式封存的 27 条裁判 YES 与 NO 结论的审计发现,其中 14 条得不到自身引用的支持,1 条可能有误。重新裁判要求存档覆盖截止前的最后 7 天,而这些窗口都在 2026-08-23 之前结束,早于保留 15 天的存档中最早的证据。因此每次运行都会把 #8995 上线(SUBJECT_GATED_SELECTION_SINCE_MS,2026-10-07T14:39Z)之前结算的每条裁判 YES 或 NO 以原因 judged_old_selection 封存为 VOID。记录保留 resolvedAt,把原始结果和证据保留在 supersededOutcome 与 supersededEvidence 中,并记录 voidedAt。该步骤在窗口更正之后运行,因此重复窗口保留 duplicate_window。作废的记录不再是 YES 或 NO,因此重复运行不会再改变任何内容。 自 issue #9011 起,每条裁判结论都以 evidence.selectionVersion 记录其裁判时所用的证据选取方式(JUDGED_EVIDENCE_SELECTION_VERSION,目前为 3:1 为按问题模板词语选取,2 为 #8995,3 为 #8999 及 #9002)。每条裁判封存都带有该标记,包括 VOID;包装证据的更正会把它保留在 supersededEvidence 下。该步骤把低于 JUDGED_MIN_TRUSTED_SELECTION_VERSION(2)的每条裁判 YES 或 NO 封存为 VOID。在该标记出现之前封存的记录按上述截止时间判定:之前为版本 1,之后为版本 3,因为在 #8995 与 #8999 上线之间没有封存任何裁判 YES 或 NO。今后证据选取方式改变时提升版本号,再提高最低版本,就恰好覆盖按旧选取方式封存的记录。 在 issue #8990 之前,押注窗口无论首次发布带的是什么都会打开,而这往往是基础概率占位值。窗口在整个生命周期内保留该占位值,种子器也不会再为它的问题运行集成。每次运行都会把以占位值打开的押注窗口以原因 base_rate_placeholder(“以基础比率占位值开启,而非模型预测”)封存为 VOID。待结窗口把原状态保留在 supersededStatus 中;已结窗口保留 resolvedAt,并把原结果和证据保留在 supersededOutcome 与 supersededEvidence 中。已经是 VOID 的占位窗口保留原因。与重复窗口一样,占位窗口从来不是一个问题,因此成绩单的任何计数(包括 VOID)都不包含它,成绩单方法说明会写明排除了多少条。因此按生成来源统计的 bet_engine 计数会减少,而不会增加 VOID。占位窗口不再拥有其问题,因此此前被 duplicate_window 更正作废为其重复窗口的后续窗口会恢复原状态或原结果,记录 duplicateRestore(formerDuplicateOf、restoredAt),并再次经过窗口更正。该问题随后按其首个集成窗口评分。截止时间或结算读取早于自身发布时间的重复窗口保持为重复窗口:它是按发布之前就已知的结果评分的,通常是同一 slug 下继承了前一个市场关闭时间和结算结果的后续市场。更一般地说,旧的仅按 slug 建键方式为同一 slug 下另一个市场生成的重复窗口,无论其读取是否早于发布,都保持为 VOID duplicate_window,并指向那个市场的窗口。例如莱茵河“9 月 1 日之前”市场就被旧键并入该 slug 的“9 月 1 日至 9 月 14 日之间”窗口。市场标题现已纳入建键,因此不会再形成新的此类重复窗口,这些记录也都不计分。更正可能把恢复的窗口改评分回其打开时的占位值,这会将其作废并恢复它吸收过的窗口,因此两个步骤会重复,直到没有窗口被恢复,账本在一次运行内收敛。重复运行不会再改变任何内容。 回执已存入 R2 之后才被更正的记录(resolver_envelope_bug、duplicate_window、judged_old_selection、late_read、resolver_could_not_read_feed、base_rate_placeholder、恢复的重复窗口、改评分、迟读重新判定或重新指向的重复窗口)会重新写入回执。R2 写入逐条进行,每条约 450 毫秒,且在运行 150 秒的抓取阶段内完成,因此每次运行最多重写 RECEIPT_REARCHIVE_PER_RUN(50)条此类回执,最早的优先。积压会在之后的运行中逐步清空,在更正后的回执写入之前,清理不会删除该记录。

评估语料

每个窗口在打开时记录 3 个来源字段(issue #7072):
  • codeVersion 是发布该窗口的种子器的部署提交。每次预测历史运行和押注历史运行都只携带一次该值。从此前写入的历史打开的窗口没有 codeVersion。
  • sla 是该窗口须遵守的服务时限,单位为截止后的毫秒数。裁判窗口为 { lane: 'judged', ms },取 DEFAULT_JUDGED_SLA_MS:从截止时间加 18 小时报道宽限期起算 2 天。硬性窗口为 { lane: 'hard', ms }:数据缺失时,其数据源让结算器在封存或作废窗口之前最长等待的时间(scripts/_forecast-resolution-eval.mjs 中的 hardResolutionBoundMs,即下文“迟读与缺失的数据源”所述的界限),再加上执行封存的那次运行 RESOLVER_CYCLE_MS。RESOLVER_CYCLE_MS 为 1 天 1 小时:一次每日运行,再加一小时启动时间余量,与 LATE_READ_MAX_LAG_MS 相同。有一项测试在每个数据源缺失时逐小时驱动结算器,核对每类窗口都在其界限内封存。各时限如下:
计数或数值窗口在数据到达后立即封存;该时限是停止运行的数据源被作废的界限,因此在时限内结算的窗口即为按时。数据源正常运行但尚未覆盖到截止时间的计数窗口会无限期等待,在数据源追上之前一直处于超出服务时限状态。时间范围窗口的时限为其采样容差加 RESOLVER_CYCLE_MS,因为它按容差内最近的采样判定。
  • emissionHash 是首次发布的 JSON 数组 [id, deadline, generatedAt, probability, resolution spec] 的 SHA-256。持有历史快照的任何人都可以重新计算它,核对该窗口是否按所发布的内容评分。
回执写入 R2 后,窗口还会记录 receiptHash,即所存回执字节的 SHA-256。该哈希可以公开;receiptArchiveKey 中的对象路径不能公开。 成绩单的 corpus 块统计评估语料。该块仅供内部使用。API、MCP 和 /accuracy/ 按字段名选取字段,不包含它,因为公开的 OpenAPI 文档已达到其大小上限。其字段覆盖 2 个不同范围,该块以 registrationScope 和 slaScope 标明。 登记字段覆盖结算器本次运行读取的历史(registrationScope: 'history_read'):最近 200 次预测运行(约 8 天)和最近 200 次押注运行(约 200 天)。
  • publishedCount 统计该历史中不同的 <id>@<deadline> 预测窗口。ledgerRegisteredCount 统计其中每次发布都被某个账本窗口覆盖的窗口,registrationCoverage 是其所占比例。只统计最近 180 天内的运行和发布。账本会把窗口保留到其结算后 180 天,而窗口在其覆盖的发布之后才结算,因此被统计的发布不会需要一个已被清理的窗口。例外是结算器在首次读取时即作废的硬性规范(unsupported_metric_key 或 missing_threshold):该窗口立即结算,并继续覆盖同一问题之后的发布。即使该窗口已被清理,这些发布仍计为已登记。historySnapshots、historyFrom 和 historyTo 描述被统计的运行。
  • 一个账本窗口会并入同一问题之后的截止时间。被并入的 <id>@<deadline> 计为已登记,但只按并入它的窗口的截止时间评分一次,从不按其自身的截止时间评分。registeredLedgerWindows 统计已登记窗口背后的账本窗口,因此小于 ledgerRegisteredCount。
  • unregisteredByReason 给出每个缺口的原因:no_resolution_spec、withheld_at_emission(提取闸门在发布时将该预测排除在评分之外,计入 withheldAtEmission)、base_rate_placeholder(只以种子器的基础概率占位值发布的影子押注,不会打开窗口)、no_deadline、deadline_passed_before_registration(截止时间早于该次发布之后的第一次结算器运行,结算器有意跳过)或 unregistered(结算器有机会打开该窗口却没有打开)。
其他字段覆盖成绩单评分的滚动窗口(slaScope: 'rolling_window'),不含重复、暂停发布和时间范围窗口。顶层计数是可归属的已发布预测(cohort: 'published_origin'),即头条群体;它不含结算台账总计会计入的状态派生和来源不明的行。byGenerationOrigin 按来源重复每项计数,使影子押注和合成记录与已发布数字分开。
  • resolvedWithinSlaCount、resolvedLateCount 和 slaUnmeasurable 按窗口上记录的服务时限,划分每个已结算窗口(包括 VOID)。在该记录出现之前打开的窗口按其规范取时限。scoredWithinSlaCount 和 voidWithinSlaCount 拆分按时结算的窗口,因为一个立即作废一切的通道会让一切都按时结算。pendingPastSlaCount 统计已超过服务时限的未结窗口。byLane 把每项计数拆分为硬性通道和裁判通道。
  • voidByReason 按原因统计两个通道的 VOID。judgedLane.voidByReason 只覆盖裁判通道。
  • byLane.<lane>.latency 给出结算时间减去截止时间的中位数和第 90 百分位数(最近秩),单位为毫秒。在截止前结算的市场得到负值。
uncertainty 块还带有公开契约容纳不下的内部区间。每个区间都按整个预测族重采样:
  • overallLogScore 和 skillLogScore 给出对数评分及其区间。
  • byDomain 和 byGenerationOrigin 给出每组的 Brier 与对数评分及其区间、该组的族数和小样本标记。与公开的分组一样,它们合并所有来源。
  • vsMarket 在已发布来源的群组上比较预测与市场。wmMinusMarketBrier 是预测 Brier 减去市场 Brier,预测更好时为负值。其配对区间让每个窗口的 2 个损失保持在一起。公开的 vsMarketSkill 仍合并所有来源。
totals 和 funnel 只统计已发布预测(issue #8990,自 schemaVersion 3 起)。未晋升的影子押注(bet_engine)会为积累证据而评分,但从不展示,因此这两个数据块都不计入它们。已晋升的押注会发布,因此计入,与头条一致。状态派生预测和来源不明(unknown)的预测曾展示给用户,因此计入。成绩单使用 2 个都称为“已发布”的统计范围。已发布预测(isPublishedEntry)指展示给用户的全部预测:totals、funnel 和 goForward 统计这一范围。可归属的已发布预测(isPublishedOriginEntry)还会排除状态派生和来源不明的行,因为它们不是可归属的模型预测:头条技能评分、publishedByDomain、回执、familyOutcomes、corpus 和校准拟合统计这一范围。影子押注仍在 byGenerationOrigin 和 betEngine 切片中单独报告,overall、calibration 和 vsMarketSkill 仍合并所有来源。/accuracy/ 为每个合并数字标注“所有来源,包括未发布的影子押注”。已结算的押注几乎从不判为 VOID,因此把它们合并进来会掩盖已发布预测的 VOID 率。以 2026-10-08 结算运行写入的账本计算,所有来源的滚动 VOID 率为 71.1%(501 条中 356 条),只算已发布预测为 94.9%(375 条中 356 条)。方法说明会写明统计范围。/accuracy/ 根据快照的 schemaVersion 在总计表和漏斗表的说明以及结论中写明统计范围,因此变更之前截取的快照仍会注明合并了所有来源;数据集下载在 ledgerPopulation 中记录该范围。 totals.publicationCoverage 已弃用。它用已评分窗口数除以所有账本条目(包括未到期的条目),因此既不衡量发布,也不衡量覆盖。成绩单仍输出该字段,以免 API 和 MCP 读取方出错。/accuracy/ 根据计数自行计算同一个账本已评分占比(按该字段原来的方式取整),并附上 95% Wilson 区间。其结论中的实际比率(头条预测和全部已评分预测成真的频率)也附有区间。每个区间只需要旁边列出的 2 个计数,因此都不占用公开契约的任何字节。 运行差异工具(scripts/diff-forecast-runs.mjs)报告 2 次预测运行之间的结构差异。其 candidateBrierDelta 始终为 unavailable,原因为 emission_snapshot_required。只有当两次运行都基于同一份冻结的发布快照进行预测,并在相同的 <id>@<deadline> 窗口上评分时,候选版本的 Brier 才能与基线比较。目前没有任何运行归档其预测时所用的输入(issue #7073)。

迟读与缺失的数据源

实时数据源(大宗商品报价、咽喉要道风险)报告的是抓取时刻的数值,因此时间点问题(at-deadline 或 at-endDate)必须在截止时间附近读取。结算器每天运行一次(cron 0 6 * * *),每次在 UTC 06:00 到 06:05 之间启动,因此截止后的第一次运行会在一个周期内读取数据源。LATE_READ_MAX_LAG_MS 等于这个周期再加一小时,用于吸收启动抖动。结算器按截止时间当时或之后、且在该界限内取得的第一个有限读数判定。界限过后仍没有这样的读数时,记录封存为 VOID:数据源缺失时原因为 feed_unavailable,数据源含有该指标但读数太迟时原因为 late_read,数据源不再包含该指标时原因为 value_source_never_settled(价格或数值)或 no_establishable_metric(其他指标)。因此一次漏跑会让间隔内到期的问题作废,而不是按之后的价格判定。按自身周期或场馆裁决标注读数日期的数据源(EIA、FRED、prediction:markets-resolution:v1)保留各自的结算宽限期,不受该界限约束;其中某个数据源缺失超过宽限期时,记录封存为 VOID feed_unavailable。计数数据源缺失超过其结算延迟加 VALUE_SETTLEMENT_MAX_LAG_MS(10 天)时,同样封存。 intelligence:gpsjam:v2 每个 UTC 日发布一份快照,日期由其 date 字段标注。GPS 干扰问题按截止时间所在 UTC 日的快照判定。seed-gpsjam 每 8 小时运行一次,第 D 天的快照最早在 D+1 日 08:00 的运行中写入,因此结算器在 D+2 日 06:00 的运行是第一次能读到它。GPS_JAM_SNAPSHOT_MAX_LAG_MS 从截止日零点起算为 3 天 7 小时:包括这第一次运行、为延迟发布的快照多留的一个周期,以及一小时的启动抖动。若数据源中的快照日期晚于截止日,说明截止日的快照在结算器读取之前已被替换,记录封存为 VOID late_read。界限过后仍只有更早的快照时,记录封存为 VOID value_source_never_settled;数据源缺失时为 feed_unavailable。 在 issue #8990 之前没有这个界限,结算器晚了数天才处理的窗口会按当天的价格判定。每次运行都会在 duplicate_window 作废之后更正这些记录。读取时间超过界限的实时数据源 YES 或 NO 记录,会按同一指标任一窗口采到的第一个及时读数重新判定;账本中没有这样的读数时,封存为 VOID late_read。被替换的结果和证据移入 supersededOutcome 与 supersededEvidence。重新判定的记录写入 regradedAt,作废的记录写入 voidedAt,resolvedAt 保持不变。更正后的记录要么读数及时,要么是 VOID,因此重复运行更正不会再改变任何内容。

结算器无法读取的数据源所产生的 VOID

有些数据源当时含有读数,但结算器无法读取,这期间封存的记录带有 no_establishable_metric,显示为“数据源没有该问题的读数”。这把结算器的故障归咎于数据源(issue #9013)。每次运行都会把这些记录重新标注为 resolver_could_not_read_feed(“我们的结算系统未能正确读取此数据源”)。一条记录满足以下条件时会被重新标注:它是已结算的硬性 VOID,原因为 no_establishable_metric,数据源属于下表之一,且封存时间早于能够读取该数据源的结算器首次部署: 结果和 resolvedAt 保持不变。原先的证据移入 supersededEvidence,voidedAt 记录重新标注的时间,因此 R2 回执会重新写入。重新标注后的记录不再带有 no_establishable_metric,因此重复运行不会再改变任何内容。VOID 不计入准确度计算,因此没有任何评分发生变化。 周期型数据源(EIA、FRED)以观测日(UTC 零点)标注每个样本。对这类数据源的时点读取,按截止时间所在 UTC 日当天或之后日期的第一个样本判定,与结算门槛接受的日期界限相同。在 issue #8990 之前,选取要求样本时间不早于截止时刻,因此截止日当天的观测被跳过,结算器改读实时数值。

校准映射(影子)

内部记分卡的 calibrationShadow 块在同一批前向行上分别评分 3 个阶段。raw 是融合后概率,即映射拟合与作用的阶段;calibrated 是映射的输出;internal 是融合前的 internalProbability,即预测器在市场锚点介入之前自己的数值。该值取自窗口打开时冻结的市场锚点记录。打开时没有市场锚点的窗口从未经过融合,因此其融合前值就是融合后值。internal 块在总体和每个领域上报告:Brier、同一批行的融合后 Brier、融合前减融合后 Brier 差值按家族整体重采样的配对自助法 95% 区间、期望校准误差及其自助法区间,以及可靠性分桶。差值为正,表示市场融合及其领域上限降低了 Brier。融合前值未知的行计入 internal.missing,不参与该阶段评分,其数值也绝不填补。这类行包括 #7071 记录之前写入的市场锚点,以及未能从首次发射恢复、只能推断的重新评分窗口,因为旧的覆盖逻辑可能已经丢掉了打开时的锚点。internal 阶段仅作报告:激活门槛仍只比较校准概率与融合后的原始概率,其结论不读取该阶段。

冻结评估队列

冻结队列从发布到结果跟踪同一组预测窗口,因此之后对结算器、成绩单筛选条件或滚动窗口的任何改动,都不能把某个条目从计数中去掉(issue #7066)。scripts/forecast-cohort.mjs 是运维工具,不是 Railway 服务。它只读取生产 Redis,并写入本地文件。 node scripts/forecast-cohort.mjs freeze --id <id> --start <iso> [--end <iso>] [--origin a,b] [--domain a,b] 读取以下数据:
  • forecast:resolutions:v1
  • 预测历史和投注历史各自最新的 200 次运行,与结算器的读取相同
  • forecast:trace:runs:v1 中的预测追踪指针
它在内存中对这些数据运行结算器自身的 ingestHistory 和发布处理函数。该时间范围内每次发布所打开的窗口,都以结算器给出的 id@deadline 键冻结,包括下一次结算器运行才会登记的窗口。有些发布没有对应窗口,例如截止时间在任何结算器运行读到它之前就已过去。这类发布同样被冻结,并记录 unregisteredReason;队列窗口缺失的时间跨度窗口也一并冻结。因此,某次发布是否计入,从不取决于冻结的执行时间。 每个条目记录其来源、领域、通道(硬性、裁判或时间跨度)、截止时间、是否属于已发布来源、emissionHash、服务时限,以及打开该窗口那次运行的代码版本。服务时限取结算器打开该行时写入的 sla。没有该标记的行按其规范取所在通道的时限,与 slaDueAt 的做法相同:硬性窗口和时间跨度窗口取 hardSlaMs,裁判窗口取 DEFAULT_JUDGED_SLA_MS。账本从未登记的时间跨度窗口,按结算器本会写入的时限冻结:其采样容差加 RESOLVER_CYCLE_MS。代码版本取以下来源中第一个有值的:
  1. 账本行上的标记
  2. 预测历史或投注历史快照上的标记
  3. 同一次运行的追踪指针
  4. 用 --carry-code-versions 指定的更早清单
否则记为 unknown。自 #9059 起,两个历史列表都在每个快照上记录代码版本,因此只要历史还在,代码版本就不会丢失。更早的快照退回到追踪指针列表(保留 50 条,约 25 次运行),或同一批窗口的更早清单。--carry-code-versions 会核对更早清单的 schema 和 manifestSha256,并且只沿用那次冻结直接读到的版本,绝不沿用它自己沿用来的版本。 范围内的每次发布都计入以下去向之一:
  • 属于队列窗口
  • 并入范围开始前打开的窗口,并按那次更早的发布评分
  • 被筛选条件排除
  • 被导入步骤跳过,并记录取自结算器 REGISTRATION_GAP_REASONS 的原因;例如 base_rate_placeholder 表示基于种子程序基准率占位值的投注,它不会打开任何窗口
以下情况冻结会拒绝执行:任一历史列表为空或已过期(即使是仅针对预测的冻结 --origin legacy_detector 也是如此,因为投影必须读取结算器读取的每次发布),或者范围起点不晚于读取到的最旧快照,因为该范围开头的运行可能已被裁掉。请在范围开始后约 8 天内执行冻结。 清单提交到 data/forecast-cohorts/ 下。其 manifestSha256 覆盖清单的全部内容,包括范围、筛选条件,以及每个条目及其服务时限。冻结从不替换已有清单:之后的冻结会读到更晚的账本和历史,因此新的冻结需要新的 --id。 node scripts/forecast-cohort.mjs reconcile --manifest data/forecast-cohorts/<id>.json 逐一检查每个冻结条目,并给每个条目恰好 1 个类别: 结算器在运行开始时读取历史,几分钟后才写入账本。因此,发布后不久的一次账本写入,并不能说明结算器读到了这次发布。RESOLVER_CYCLE_MS(1 天 1 小时,即成绩单使用的结算器周期)就是等待时长。 对账通过成绩单的 slaDueAt,把每个条目冻结的服务时限应用于账本当前记录的截止时间。裁判窗口的时限从 18 小时报道宽限期结束后开始计算。市场结算窗口按其当前截止时间评判。硬性窗口的等待时长与其数据源按设计让结算器等待的时间相同,例如:实时时点读取为 2 天 2 小时,EIA 或市场结算为 15 天 1 小时,月度 FRED 为 76 天 1 小时。 结论只覆盖已发布来源的条目,即史诗验收标准所指的群体:
  • met:所有条目都在服务时限内终结
  • breached:列出了任何违约
  • open:其余情况
影子(bet_engine)和合成窗口单独给出结论。报告按通道、来源和代码版本统计每个类别,按原因统计 VOID,并按键列出每个违约条目。如果清单与其哈希不再一致,对账会拒绝执行。 结算器会在结算 180 天后清理已结算的行。此后再对账,相应条目会显示为 missing_from_ledger,因此请在此之前完成队列对账。

运行存档与重放

每次 seed-forecasts 运行都会把输入写入 R2 中私有的预测追踪存储桶,文件名为 deep-snapshot.json。快照包含检测器读取的原始数据源、记录下来的关键信号包、本次运行生成的全部预测,以及 triggerContext.deployRevision 中的代码版本。自 issue #9058 起,快照还包含 calibrationPublication:本次运行评分时使用的校准模式、原因、映射版本和决策时间,以及映射中各领域的节点。 运行在追加历史条目之前计算 snapshotSha256,即实际写入字节的 SHA-256。历史条目带有 runId 和 snapshotSha256,追踪清单和追踪指针带有该摘要。结算器开启账本窗口时,会把 runId 和 snapshotSha256 复制到该行,该行的 R2 回执也会保留它们。与开窗概率一样,这一关联在窗口开启时确定,之后的再次出现不会改变它。#9058 之前开启的行没有关联。公开成绩单回执不包含这两个字段。如果快照在历史追加之后写入失败,摘要指向的对象并不存在,重放工具会报告快照缺失。 每次 seed-forecast-bets 运行会以相同的日期目录结构写入 bets-input-snapshot.json,运行目录名为 <generatedAt>-bets。其中包含通过新鲜度过滤后的 bet 数据源、本次运行更新前的滚动序列,以及在集成阶段运行时的未结问题标记、新闻标题、集成提示词摘要,和每次 LLM 调用的提供方与模型。bet 播种器在追加历史条目之前写入快照,因此 bet 行的 snapshotSha256 总是指向已写入的对象。把存档的数据源、generatedAt 和序列传给 buildBetsSnapshot,可以重现每一个 baselineProbability。集成概率来自 LLM,因此作为记录的输出保留,不做重放。 scripts/replay-forecast-detectors.mjs 用于重放一次运行。它接受账本键(--entry-key)、运行 ID(--run-id)或本地文件(--snapshot)。它使用 R2 追踪凭据读取快照,并用记录的摘要进行校验:账本行的摘要、该次运行追踪清单中的摘要,或通过 --sha256 给出的摘要。没有记录摘要的快照(例如 #9058 之前的快照)需要 --trust-unverified。工具只运行 origin/main 上的代码版本,因此只能从 fork 的拉取请求访问的提交永远不会被运行。它把记录的代码版本检出到临时 git worktree,然后在子进程中重新运行检测器和评分;对 bet 运行则重新运行 buildBetsSnapshot。子进程只获得 PATH、TZ 和一个临时 HOME,在仓库之外运行,禁用 fetch,时钟冻结在快照的 generatedAt。若出现任何其他环境变量,它会中止。这能让可信代码接触不到凭据,但它不是运行不可信代码的沙箱。它报告与记录的预测及其时间跨度投射相比,完全一致、不同、缺失和多出的数量。对于账本行,它把重放结果与窗口的评分值 firstSeenProbability 比较。--candidate 会在当前代码上再运行一次并单独标注,因此代码变更不会被误判为快照失败。重放被中断时,工具会停止子进程并删除临时文件。#9058 之前的行,会匹配到运行 ID 生成时间早于该行 generatedAt 不超过 15 分钟、且快照带有相同 generatedAt 的那次运行。 快照包含受许可约束的第三方数据,包括 ACLED 事件和新闻,必须保持私有。快照从不公开,其内容也从不张贴。重放工具只把快照保存在当前用户可读的临时文件中,用完即删除,并且只输出预测 ID 和数值。快照的保留期至少应为最长时间跨度 210 天加上结算延迟。自 2026-10-09 起,追踪前缀下按日期划分的运行目录在 400 天后删除,每年一条生命周期规则(2024 至 2027 年)。这些规则在存储桶配置中设置,而不是在本仓库中设置;2028 年的规则必须在 2028-01-01 之前添加。这些规则都不得覆盖结算回执,结算器也会拒绝把回执写在追踪前缀之内。

层级与门控

在 Web 端,AI Forecasts 目前处于 试用 阶段 — 对所有人免费,包括未认证读者。在 桌面 端,同一面板在 src/config/panels.ts 中以 premium: 'locked' 发布,因此在那里是门控的。此拆分反映了产品当前的试用定位;预计 Web 端门控将随时间收紧。

API 参考

  • Forecast service — 涵盖 get-forecasts、get-forecast-scorecard、get-simulation-outcome、get-simulation-package 和 trigger-simulation。
  • 关于程序化预测生成(在缓存的 cron 输出之外生成新概率),请参见 MCP generate_forecasts 工具。