导读中科闻歌的 Decitron 把世界状态、多主体模拟和预测校准组织进一套决策框架。其技术报告列出了 78.41%、72.80% 和 PolyBench 81.20% 等醒目数字。读这些结果,第一步是分清概率评分与预测命中率;第二步是核对同一表格里不同指标能否按给出的公式对上。报告展示了值得研究的系统设计,也留下了需要作者澄清的评测口径。
本文 1804 字,阅读约 5 分钟|同样写着百分比,报告其实回答了两道题 → 78.41% 是概率评分,不能直接当命中率 → 数字高于基线,还要看比较条件 → PolyBench 的 81.20% 与 0.822%,为什么需要再问一句 → 这份报告现在能支持怎样的判断
同样写着百分比,报告其实回答了两道题
Decitron 的技术报告于 2026 年 8 月 3 日提交至 ChinaXiv。它讨论的不是让模型只回答一次“会不会发生”,而是先把当前信息整理成可更新的世界状态,再模拟不同参与者的行动,最后给未来路径分配概率。这个流程由 MetaWorld、状态—行动—结果表示(SAO)、多主体模拟和预测校准等部分组成。
这样的设计有意思,但系统有多少模块,与它预测得有多准,是两件需要分别验证的事。本文核对报告第 9 节的两组预测结果:一组来自团队自建的事件题,另一组使用 PolyBench 预测市场数据。它们的任务和指标都不同,不能把其中的百分比排成一张统一的“准确率榜”。
自建测试覆盖 2024 至 2026 年的 74 个事件,每个事件抽取 5 个二元问题,共 370 题。模型要为“会发生”给出一个 0 到 1 的概率。PolyBench 部分则涉及预测市场事件、终局结果以及市场概率变化。读者需要先弄清:每个数字是在奖励选对方向,还是奖励概率报得接近结果。
78.41% 是概率评分,不能直接当命中率
自建测试的主指标是 Brier 分数:预测概率与实际结果之间的差,平方后取平均。实际发生记为 1,未发生记为 0;分数越低,概率预测越贴近结果。报告又把它转换成百分比形式的 Brier Index:(1 − √Brier 分数) × 100%,数值越高越好。
举一个只为解释指标的例子:某事件确实发生,模型事前给出 70% 的发生概率。如果另按 0.5 的门槛判断,它“选对了”;这一题的 Brier 分数是 (0.7 − 1)² = 0.09,转换后的 Brier Index 为 70%。一次判断的命中结果是对或错,Brier Index 还会计入概率离结果有多远。
报告 Tables 3–4 给出 Decitron 平均 78.41%、短期组 72.80%。按照前一节给出的主指标,这些百分比应按 Brier Index 理解;但表格没有单独标出指标名,报告正文又把它们称为“accuracy”。报告也未说明先汇总 Brier 分数再转换,还是先逐题转换再取平均。因此,不能据此说“370 题答对了 78.41%”或“短期事件命中率是 72.80%”。
图片说明:报告 Tables 3–4 列出 78.41% 和 72.80%;阅读时需结合前一页的 Brier Index 定义,不能直接按命中率解释 图片来源:Decitron 技术报告 V1,第 21 页,Tables 3–4
数字高于基线,还要看比较条件
报告把 Decitron 与 GPT-5.5、Claude-4.7 比较,后两者分别有直接预测的 LLM-ONLY 和加入历史新闻的 LLM-NEWS 两种设置。在 Table 4 的短期组,Decitron 为 72.80%,两个 LLM-NEWS 基线分别是 35.43% 和 44.62%。这支持的有限结论是:在作者设置的任务与评分方式下,Decitron 报出的分数更高。
它还不足以回答“究竟是哪个模块带来了提升”。Decitron 使用持续维护的状态、多主体推演和校准等整套流程;基线则按各自的提示方式给概率。要把优势归因给世界模型、模拟器或某一步校准,需要相应的消融实验,让其他条件尽可能保持一致。
时间也是预测任务的硬条件。报告说各模型只能使用题目发布时间之前的信息,并提醒模型不要依赖此后的知识;但对于训练时已经见过历史事件的通用模型,提示词本身不能证明没有未来信息泄漏。要判断这组差距有多稳,还需要看到逐题发布时间、可用证据、各系统的实际输入和原始概率输出。报告表格本身没有提供这些核对材料。
PolyBench 的 81.20% 与 0.822%,为什么需要再问一句
另一张表容易造成新的混读。报告在 PolyBench 部分定义了终局预测准确率 FFA:以 0.5 为门槛,把模型给出的概率转成“发生/不发生”,再计算选对的比例。Table 5 中,Decitron 的 FFA 是 81.20%。这一次,81.20% 才是报告定义下的分类命中率。同表还列出 EVPA 73.40%,它衡量预测市场概率变化方向是否判断正确。
分类命中率只看概率落在 0.5 的哪一侧。对最终发生的事件,报 51% 和报 99% 都算选对;但两者对不确定性的表达不同,平方误差也不同。所以,还得单独检查概率误差,不能用 FFA 替它作证。
问题出在均方误差 MSE。报告给出的公式是每题预测概率与实际 0/1 结果之差的平方,再取平均;Table 5 的列名写着 MSE (%),Decitron 数值为 0.822。
图片说明:Table 5 同列给出 FFA 81.20% 与标为 MSE (%) 的 0.822;两者能否按文中公式比较,取决于实际样本、单位和计算口径 图片来源:Decitron 技术报告 V1,第 22 页,Table 5
若 FFA 与 MSE 用的是同一批二元题、同一组概率,81.20% 的 FFA 意味着约 18.80% 的题落在门槛错误的一侧。每道错题的平方误差至少是 0.25,于是整体 MSE 至少约为 18.80% × 0.25 = 0.047,换成百分比约为 4.7%。这与表中的 0.822% 对不上。
这是一条带前提的算术检查,不是对模型实际表现的判定。若 MSE 另有缩放方式、使用不同样本或并非以终局 0/1 结果计算,报告需要把口径说明白。现在不能拿 0.822% 直接证明“概率误差极小”,也不能据此反推出 Decitron 的真实 MSE。
还有一层来源关系:PolyBench 原论文重点评估带时间戳的预测市场数据和交易表现,使用了收益、年化收益和夏普比率等指标。Decitron 报告在其数据上增加 FFA、EVPA、MSE 的比较,并在 Table 5 表注说明部分基线结果由本报告补测。因此,这张表应称为 Decitron 团队在 PolyBench 数据上的评测,不能直接当成 PolyBench 官方榜单。
这份报告现在能支持怎样的判断
这份报告公开了从证据整理、状态维护到多主体推演和概率输出的系统设计,也在自建测试和 PolyBench 数据上报告了相对所选基线的优势。但这些结果尚不足以支持“事件命中率达到 78.41%”或“概率误差只有 0.822%”这样的说法:前者的指标名称与汇总方式需要写清,后者的单位、样本和计算口径需要对齐。
要判断 Decitron 的预测概率是否可靠,需要公开逐题原始概率、题目发布时间、各系统实际输入和完整的指标计算方法,并接受独立复现。这些材料能让外部研究者检验报告中的分数优势。
参考资料
Decitron 技术报告 V1: https://chinaxiv.org/abs/202608.00064
PolyBench 原论文: https://arxiv.org/abs/2604.14199
PolyBench 官方仓库: https://github.com/PolyBench/PolyBench
中科闻歌 Decitron 产品页: https://www.wenge.com/site/69c9202de4b03b4745b93856
参考文章《全球首个通用决策大模型,AI 推演现实世界的技术揭秘》: https://mp.weixin.qq.com/s/2S69Gxt_eUm3yPyC0aNnmw
— THE END —
文章仅做学术分享,如有侵权请联系删除,非常感谢!

