DigClaw称其 AI 预测框架 Rhizome 在 FutureX 拿下三个前十席位

DigClaw称其 AI 预测框架 Rhizome 在 FutureX 拿下三个前十席位

N
News Editor
2026-08-25 02:36:09
DigClaw 表示,其预测框架 Rhizome v1 于 7 月在 FutureX 实时预测榜单上分别基于 Kimi-K3、DeepSeek-V4-Pro 等不同基础模型拿下第 1、第 3 和第 7 名。公司称,这是同一套框架在不同基座上的独立运行结果,指向预测能力可沉淀在基础模型之外。文章披露了 Rhizome 的三项设计,包括搜索与推理解耦、预测轨迹记录与概率校准,以及因果链感知的持续更新,并称相关系统已用于内部投资实践。

DigClaw 表示,其预测框架 Rhizome v1 在 7 月于 FutureX 评测平台上拿下 #1、#3、#7 三个席位,分别来自不同基础模型的独立运行结果。文中提到的基座包括 Kimi-K3、DeepSeek-V4-Pro 等,而同一套框架同时让多个基座进入 Top 7,DigClaw 称自己是唯一做到这一点的参赛方。

DigClaw称其 AI 预测框架 Rhizome 在 FutureX 拿下三个前十席位 2

按照原文说法,FutureX 的这组结果来自 59 道覆盖政治、经济、科技领域的真实事件预测题,提交预测时标准答案尚未产生,且不存在训练数据泄露的可能。DigClaw 据此提出的判断是,预测能力可以沉淀在基座模型之外;随着基座进步,系统可以获得能力红利,而预测轨迹、结算反馈、校准经验和持续演化的工作流则保留在系统内部。

DigClaw为何把这次排名视为外部验证

DigClaw 将这次成绩描述为其对「预测到底应该怎么做」这一问题获得的第一次外部验证,而非一次偶然的竞赛结果。

文中认为,随着预测任务逐步走向标准化和工程化,AI 被寄予规模化处理复杂预测问题的期待,但大语言模型天然并不擅长预测。其给出的理由是,LLM 学到的是 correlation,而不是 causation;从过去语料中提取模式,与预测未来并不是一回事。

DigClaw 在文中列出三点局限。第一,因果方向盲区。模型知道 A 和 B 经常一起出现,但不知道究竟是 A 导致 B、B 导致 A,还是存在共同原因 C。第二,干预推理失效,像「如果美联储降息,会对东南亚科技股产生什么影响」这类问题,缺少因果图谱支撑干预计算。第三,校准缺失,模型输出的「70% 概率」没有经过概率论意义上的校准,本质上只是 token 分布的副产品。

DigClaw 还提到,现有方案各有边界:人类群体智慧即 prediction markets 需要流动性,冷门问题上价格不可信;LLM 的模式匹配缺少因果结构;端到端训练则存在结果导向偏差,一个逻辑严密但答错的推理过程会被惩罚,碰巧猜对的粗糙判断反而可能被强化。

基于这一判断,DigClaw 将自身定位为一套预测基础设施:以因果结构为骨架、以概率计算为引擎、以搜索智能为数据管道。其核心假设是,预测不应由一个模型端到端完成,搜索、因果推理、概率推断是三个正交能力,应该交由三个专门系统分别处理,再结构化组合。

三个前十名次与跨基座迁移能力

在原文中,FutureX 被描述为一个难度很高的实时预测榜单。平台按周发布真实世界事件预测题,参赛方在答案尚未揭晓时提交预测,事后再统一结算。

DigClaw 称,该数据集托管在 HuggingFace,评估框架开源在 GitHub,因此结果可复现、可验证。Rhizome 在三个基座上采用相同预测框架和相同运行条件,各自独立生成并提交答案,没有进行跨模型聚合。

这意味着,#1、#3、#7 三个名次并不是多个模型投票后的综合结果,而是同一套系统方法在三个不同基座上的分别运行结果。DigClaw 借此说明,如何组织检索、处理时间、表达概率、维护证据和控制长程运行,可以形成独立于模型权重之外的系统能力。

DigClaw称其 AI 预测框架 Rhizome 在 FutureX 拿下三个前十席位 3

不过,文中也明确表示,这并不意味着基座模型不重要。基础模型仍然提供语言理解、推理和工具使用等通用能力。Rhizome 试图做的是,把预测协议、Agent 编排、工具调用和结果评测放在基座之外,让机构根据任务价值和运行规模,在推理能力、成本和响应速度之间做选择。

设计决策一:搜索与推理解耦

DigClaw 在技术报告中写道,Rhizome 的第一项工程判断是,搜索和推理必须解耦,而且这两部分最好由多模型协同完成。

其核心观点是,搜索质量和推理质量是两个正交问题,不应由同一个模型同时优化。文中将 Perplexity、Gemini Deep Research 这类主流 DeepResearch agent 归为把搜索和推理绑定在同一模型内的范式,认为这样会让搜索质量受到推理负担拖累,也会让推理质量受到搜索噪声污染。

Rhizome 的做法是把二者彻底拆开:搜索 agent 只负责找相关信息,推理层只在已有证据上做结构化推理。DigClaw 强调,预测任务对信息的需求不是「准确回答用户问题」,而是尽可能发现所有相关联的信号。因此,搜索 agent 的优化目标应该是信息相关性 relevance,而不是答案正确性 accuracy;如果搜索 agent 被训练成去「找答案」,它会倾向于找到看起来像结论的内容,这在预测任务里反而更危险。

在训练路径上,Rhizome 采用 SearchRL 的强化学习框架,分成两条路线并行迭代:

  • 路径 A:针对 8B、30B 参数的开源模型,以搜索相关性为 reward 进行 RL 微调,文中引用的参考包括 Search-R1(COLM 2025)和 ReSeek(ICML 2026)。
  • 路径 B:针对 Claude、GPT 等闭源模型,构建外部搜索约束框架,即 Harness。

DigClaw 观察到,不同基座在预测任务中的能力差异比较稳定:有的更适合长时间检索和复杂推理,有的更擅长定量建模,也有的在成本和响应速度上更占优。Rhizome 的系统设计因此将基座与外层协议拆分,方便按任务做取舍。

设计决策二:记录预测轨迹并做概率校准

Rhizome 的第二项设计重点,是将每一次预测都保存为一条带版本信息的完整轨迹。DigClaw 列出的记录内容包括:题目的时间条件与结算标准、预测时可获得的证据、Agent 编排与工具调用过程、最终答案与概率,以及对应的模型和系统版本。

这些记录都形成于结果揭晓之前,因此保留的是系统在尚不知道答案时做出的真实判断。事件结算之后,Rhizome 会把现实结果补回同一条记录,用来回看当时掌握了哪些信息、漏掉了哪些反向证据,以及问题出在检索、时间判断、推理、答案表达还是概率校准。

DigClaw 特别区分了两类错误:一次高置信度错误,与一次接近五五开的错误,虽然最终都会被记为答错,但暴露出的系统问题并不相同。

对于同一道题,Rhizome 会进行多次独立预测,但不会把结果简单平均。原文称,系统会先在对数几率 logit 空间聚合,再结合已结算题目的 Brier Score 调整极端化强度。不同轨迹提供的信息越独立,聚合结果就可以越明确;证据重叠越多,调整就越克制。

DigClaw称其 AI 预测框架 Rhizome 在 FutureX 拿下三个前十席位 4

在这一步之后,Rhizome 还会通过 Platt 缩放,利用已结算题识别持续的过度自信或过度保守,并校正后续概率输出。DigClaw 给出的校准标准很直接:如果系统长期给出 60% 的事件,那么这些事件最终约有六成应当发生;如果给出 80%,长期结果也应接近八成。

文中提到,每次运行都绑定当时的系统版本与关键配置,这让概率变化和异常结果可以追溯到具体原因。即便基座升级或替换,问题定义、证据记录、信念变化、结算结果和校准经验仍可保持连续。

DigClaw 认为,这类反馈数据无法在结果揭晓后批量补造,因为每个样本都必须在未来尚未发生时先留下判断,再等待现实给出答案。代码可以复刻,但依赖时间积累的数据资产无法速成。

设计决策三:让概率更新感知因果链

对于尚未结算的事件,DigClaw 认为系统必须持续吸收新信息,并判断原有概率是否应该更新。Rhizome 为未结算问题保存信念状态,并对每条证据分别记录事件发生时间、内容发布时间和系统读取时间。

当新信息与既有记录完全重复时,系统会跳过更新;如果新证据与旧记录冲突,旧证据不会被删除,而是保留判断被修正的过程。文中还设定了一项约束:单次概率变化超过 0.15 时,必须能够指向触发变化的具体新证据。

DigClaw 认为,真正棘手的问题在于,新的证据究竟代表多股独立力量,还是同一条因果链在不同位置留下的信号。原文举例称,加息公告、利差变化和资本流动可能先后出现,但它们未必是三份独立信息;如果系统把它们分别计入概率更新,同一个原因就可能被重复计算,从而把概率推向过度自信的极端。

因此,Rhizome 正在开发一套因果链感知的贝叶斯更新框架。在证据进入概率更新之前,系统会先识别其所属的因果传导链,再依据链内关系调整证据权重。

按照文章描述,这一框架包含四个层次:

  • 因果知识库:存储经过验证的因果链,并记录关键关系的传导时滞、影响衰减和历史可信度。
  • 同链信号去重:来自同一条因果链的后续信号,不再以完整权重重复计入。
  • 全局后验帽:限制多条同向证据带来的累积影响,并根据预测期限调整约束强度。
  • 传导时滞感知:链头事件发生后,系统按因果关系的传导进度逐步更新,而不是立刻把全部影响一次性计入链尾结果。

DigClaw 称,在其内部预测系统中,这套框架已完成原型实现和初步验证,并已指导多笔投资实践。文中给出的实验结果显示,相比直接贝叶斯聚合,同链信号去重和全局后验帽把过度自信率——即预测概率高于 85% 但最终判断错误的比例——从约 25% 降到 12%。

为什么一家投资机构要做预测模型

文章同时介绍,Newborn Ventures 由 DigClaw 发起,被描述为全球首家以 AI 挖掘 Beta 趋势为驱动的投资和孵化机构,而 DigClaw 的趋势预测基座构成这家 AI-Native VC 的底层技术框架。

DigClaw称其 AI 预测框架 Rhizome 在 FutureX 拿下三个前十席位 5

DigClaw 的判断是,投资的本质就是预测。无论是判断一个赛道是否会爆发、一个团队能否跑出来,还是一项技术会不会成为主流,本质上都属于预测问题。文中称,传统投资依赖合伙人的经验、直觉和信息差,而 DigClaw 相信,这类判断可以被系统化、模型化。

从更大的视角看,原文将投资回报拆分为 Beta(事件或趋势驱动)与 Alpha(资产特异性)两部分。DigClaw 认为,Alpha 研究已经相对成熟,但 Beta,也就是对宏观事件和趋势的预测,仍缺少真正有效的 AI 解决方案,这正是其要解决的问题。

文章进一步写道,当预测从一种直觉判断变成可调用、可集成、可校准的参数,它可以嵌入的决策场景会显著增多。对上市公司而言,意味着在产业链变动和政策风向形成前完成战略预判与风险预警;对投资机构而言,意味着在共识形成前发现价值;对政府引导基金而言,意味着用系统化方法研判产业趋势与政策效果。

按照原文描述,同一套预测能力,一方面在 FutureX 接受公开评测,另一方面用于内部投资决策,同时也向产业方、金融机构和政府引导基金开放服务。DigClaw 表示,对 DigClaw 和 Newborn Ventures 而言,FutureX 第一名只是起点。

关于 DigClaw 与 Newborn Ventures

DigClaw 在文中被介绍为一家专注于预测智能的 AI 科技公司,核心使命是构建可校准、可审计、可集成的预测基础设施。其旗舰预测框架 Rhizome 采用因果推理、概率校准和搜索智能三层架构,目标是形成独立于基础模型的系统能力,即基座可更换,预测资产持续积累。

文章称,DigClaw 的预测系统已经在 FutureX 等公开评测平台上获得外部验证,并将同一套能力应用于投资决策、产业趋势研判和战略风险评估等场景,也向产业方、金融机构和政府引导基金开放合作。

Newborn Ventures 则被定义为一家 AI 原生的早期风险投资与孵化机构。其核心信念是,投资的本质是预测,判断赛道是否爆发、团队是否能跑出来、技术是否会成为主流,都可以被系统化和模型化。

原文称,Newborn Ventures 通过自研 Deep Research Agent 和因果预测系统,在全球范围内追踪 AI 推理方向的创新信号,寻找尚未被市场定价的结构性机会,也就是其所说的真正 Beta。从首次接触到投资决策,这家机构用 AI 重构了每个环节,并承诺在 48 小时内给出有技术深度的明确反馈。

原文注明,本文系量子位授权刊载,观点仅代表原作者;文章来源为微信公众号「量子位」,作者为允中。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
50

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。