DeepEvidence vs Biomni vs ToolUniverse:Nature MI 2026

2026/07/28

核心要点

  • DeepEvidence 是在生物医学知识图谱上做深度研究的 AI Agent,检索对象是图谱而非网页文本
  • 架构:一个 orchestrator + 两种检索模式——BFRS(广度优先)与 DFRS(深度优先)
  • 4 个公开 benchmark 全部第一:HLE-Medicine 40.0%、LabBench-LitQA2 80.0%、SuperGPQA-Medicine-Hard 47.1%、TrialPanorama-EvidenceQA 96.0%
  • 新构建的 7 项发现全周期任务上全面超过 BiomniToolUniverse
  • 发表于 Nature Machine Intelligence(2026),代码随 BioDSA 框架发布
  • 评测数据集开放:159 行,Apache 2.0,托管在 Hugging Face

DeepEvidence 是什么?

DeepEvidence 是一套面向异构生物医学知识图谱的深度研究 AI Agent 框架。

核心属性:

它针对的问题:

  • 多数 deep research agent 只读互联网规模的文本语料
  • 生物医学知识存在于结构化图谱中,各家 schema 互不兼容
  • 跨资源实体对齐薄弱,多跳证据链因此断裂
  • 工具套件庞大的通用 agent 会出现「工具混淆」——选到无关工具、走错推理路径

架构怎么运作

四个组件:

组件职能
Orchestrator agent制定研究计划,决定 BFRS/DFRS 的调用顺序与每步的研究目标
BFRS agentBreadth-First ReSearch——跨图谱广度查询,扫一跳邻域
DFRS agentDepth-First ReSearch——从 BFRS 捞出的关键实体出发做多跳追踪
Evidence graph内部记忆,增量更新,记录实体、关系与支撑证据

**为什么不叫 BFS/DFS:**agent 自主选择遍历步骤,而非遵守固定的图论规则。它还能通过识别共享实体在异构图谱之间搭桥,论文称之为 bridge entities

执行沙箱:

  • Agent 写代码并执行,大规模调用知识图谱 API
  • 检索结果落盘为结构化文件(如表格)
  • 下游抽取与分析在同一受控环境内完成
  • 一次药物查询可并行扇出到 KEGG、ChEMBL、OpenFDA 和 Open Targets

**工具库内的 16 个知识库:**BioThings、ChEMBL、ClinicalTrials.gov、Gene Ontology、Human Phenotype Ontology、KEGG、NCBI Datasets API、OpenFDA、Open Genes、ProteinAtlas、PubChem、PubTator、PubMed、Reactome、UMLS、UniProt。统一基因/药物检索工具还会额外查询 Open Targets。


实测数据:4 个公开 benchmark

所有 agent 系统使用同一底座(GPT-5),LLM 基线均配备文献检索能力。

Benchmark题量DeepEvidenceBiomniToolUniverseSonnet-4.5GPT-5
HLE-Medicine30 题40.0%20.0%10.0%3.3%3.3%
LabBench-LitQA225 题80.0%32.0%未报告48.0%未报告
SuperGPQA-Medicine-Hard172 题47.1%40.7%未报告43.6%未报告
TrialPanorama-EvidenceQA50 题96.0%84.0%未报告88.0%未报告

「未报告」指论文正文未给出该数值。

评测集怎么构建的:

  • HLE-Medicine:取 HLE 中学科标为「Medicine」的题,剔除需要图像输入的 → 30 题
  • LabBench-LitQA2:从 LitQA2 子集随机抽 25 题
  • SuperGPQA-Medicine-Hard:难度「Hard」∩ 领域「Clinical Medicine」→ 172 题
  • TrialPanorama-EvidenceQA:取最新 50 道 EvidenceSummary 题,并把原本给定的摘要从输入中删掉,逼 agent 自己去找文献

最后这个改动信息量最大。删掉摘要后,任务从「摘要总结」变成「检索 + 推理」,96.0% 对 Sonnet-4.5 的 88.0% 是在这个更难的设定下测出来的。


实测数据:7 项发现全周期任务

作者新构建了一批任务,覆盖药物发现、临床前研究、临床试验设计和循证医学。

任务指标DeepEvidenceBiomniToolUniverseLLM
靶点识别准确率68%56%40%42%
作用机制与通路推理准确率72%44%44%52%
体内代谢通量响应准确率80%68%52%60%
样本量估算准确率68%20%32%24%
给药方案设计准确率52%36%28%20%
替代终点发现F173.3%60.9%61.9%58.7%
证据缺口发现缺口检出率90.0%50.0%15.0%10.0%
证据缺口发现召回率44.14%30.17%5.06%2.67%

替代终点发现的完整拆解:

  • DeepEvidence:精确率 73.2% / 召回率 75.0% / F1 73.3%
  • Biomni:60.8% / 64.3% / 60.9%
  • ToolUniverse:57.7% / 69.0% / 61.9%
  • LLM:58.4% / 61.9% / 58.7%

最难的几项任务怎么造的:

  • 靶点识别:解析 85 条 KEGG 人类疾病通路的 KGML 文件,构建有向信号图;真值由拓扑逻辑引擎按路径极性打分得出,而非人工标注;每题 10 个候选基因
  • 样本量估算:取 TrialPanorama 样本量实例中最新的 25 个试验
  • 证据缺口发现:给 agent 一篇系统综述的研究问题、目标和纳入标准,要它找出原综述遗漏的试验;按前 30 条候选打分

两个最大的差距值得单独点出来。样本量估算:68% 对 Biomni 的 20%。证据缺口检出:90.0% 对 ToolUniverse 的 15.0%。这两项的答案都只能靠真正读完大量既往试验才拿得到。


为什么它赢了 Biomni 和 ToolUniverse

论文自己给的解释落在检索深度上,与工具数量无关。

维度DeepEvidenceBiomni / ToolUniverse
知识图谱 API 覆盖16 个知识库同样接入大量 KG API
检索行为结构化 BFRS→DFRS 遍历搜几次就直接作答
记忆持续更新的 evidence graph无持久化证据结构
工具选择领域专用引导庞大异构工具集 → 工具混淆
观察到的失败模式检索浅、选错工具、被噪声工具输出干扰
可追溯性Evidence graph 可供人工审查仅有推理轨迹

Biomni 和 ToolUniverse 本来就能访问其中大部分 API。测出来的差距来自 agent 作答前走了多少跳,以及是否把找到的东西结构化地记了下来。


该选哪个 Agent?

选型决策树:

  • 证据综合、系统综述更新、试验设计 → DeepEvidence,缺口检出(90.0%)和 EvidenceQA(96.0%)是它实测最强的两条轴
  • 广覆盖的通用生物医学任务Biomni,走的是广度路线
  • 给自己的推理模型接工具层ToolUniverse,600+ 科研工具与 MCP server
  • 自己搭生物医学 agentBioDSA,内置 DeepEvidence 与另外 7 个已发表 agent,并提供 Claude Code / OpenClaw 技能包
  • 评测假设验证类 agentBioDSA-1K,1,029 个任务,跑在患者级 cBioPortal 数据上

按角色:

临床证据团队:

  • 推荐方案:DeepEvidence
  • 核心理由:新增相关试验的缺口检出率 90.0%,PubMed 检索型 LLM 只有 10.0%
  • 注意:召回率 44.14%,它给的是待人工筛查的候选集,而非完整清单

药物发现团队:

  • 推荐方案:DeepEvidence,用于靶点识别(68%)和机制推理(72%)
  • 核心理由:推理前会先跨数据库对齐基因身份
  • 注意:给药方案设计只有 52%,是七项任务里最低的

论文自陈的局限

作者对系统做不到什么写得很直接:

  • 覆盖不完整——现有 benchmark 只反映生物医学研究任务的一个子集
  • 依赖高质量图谱——KEGG、Gene Ontology 这类 schema 稳定、API 质量高的资源;企业自建或内部托管的图谱存在缺失值和结构不一致,需要 agent 自行构造访问工具
  • 只有两种遍历策略——BFRS 与 DFRS 相比通用 agent 有明显提升,作者明说这两者不太可能是最优解
  • 多项任务未达专家水平——给药方案设计 52%、证据缺口召回 44.14% 是最明显的例子
  • 仅限文本模态——影像、结构生物学、蛋白质组学属于后续工作

常见问题(FAQ)

Q1:DeepEvidence 到底是什么?

DeepEvidence 是面向生物医学知识图谱的深度研究 AI Agent 框架。它用一个 orchestrator agent 调度广度优先(BFRS)和深度优先(DFRS)两类研究子 agent,并在检索全程维护一张内部 evidence graph,记录实体、关系与支撑证据。

Q2:DeepEvidence 发表在哪?

Nature Machine Intelligence(2026),标题为 "Empowering biomedical evidence exploration and synthesis with deep knowledge graph research"。预印本为 arXiv:2601.11560,2025 年 12 月 23 日提交。作者单位覆盖 Keiji AI、大阪大学、京都大学、美国国立医学图书馆(NIH/NLM)、威尔康奈尔医学院和 UIUC。

Q3:DeepEvidence 和 Biomni 比怎么样?

在同一 GPT-5 底座下,DeepEvidence 在 4 个公开 benchmark 和 7 项自建任务上全部超过 Biomni。差距最大的三项:LabBench-LitQA2 80.0% 对 32.0%,样本量估算 68% 对 20%,证据缺口检出 90.0% 对 50.0%。论文把差距归因于结构化深度遍历加 evidence graph 记忆。

Q4:DeepEvidence 开源吗?

Agent 实现随 BioDSA 框架发布在 github.com/RyanWangZf/BioDSA,MIT 协议。评测数据集在 Hugging Face 上为 zifeng-ai/DeepEvidence,Apache 2.0,159 行、7 类任务,纯评测用途。

Q5:DeepEvidence 会查哪些知识库?

16 个:BioThings、ChEMBL、ClinicalTrials.gov、Gene Ontology、Human Phenotype Ontology、KEGG、NCBI Datasets API、OpenFDA、Open Genes、ProteinAtlas、PubChem、PubTator、PubMed、Reactome、UMLS、UniProt。统一基因/药物检索工具会额外查询 Open Targets。

Q6:能在自己的数据上跑吗?

当前系统面向的是 schema 稳定、API 质量高的公开图谱。作者把企业自建或内部托管的图谱列为后续工作,需要 agent 自行构造访问工具。

Q7:DeepEvidence 和 BioDSA-1K 有什么区别?

DeepEvidence 是 agent,BioDSA-1K 是 benchmark,两者出自同一团队。DeepEvidence 做知识图谱深度研究;BioDSA-1K 用 1,029 个跑在患者级 cBioPortal 数据上的假设验证任务给 agent 打分。两者都通过 BioDSA 框架分发。

Q8:它能取代人工做系统综述吗?

证据缺口发现的召回率是 44.14%,即前 30 条候选覆盖不到一半的真阳性。它的定位是加速筛查、由人工复核,evidence graph 的存在正是为了让中间关系可被审查。


总结

DeepEvidence 把 deep research 的循环直接建在生物医学知识图谱上,而通用 deep research 系统依赖互联网规模文本。

核心结论:

  • 深度压过工具数量:同一 GPT-5 底座下,结构化 BFRS→DFRS 遍历加 evidence graph 记忆,跑赢了 API 访问能力相当的 agent
  • 实测最大差距:LabBench-LitQA2 80.0%(Biomni 的 2.5 倍)、证据缺口检出 90.0%(ToolUniverse 的 6 倍)、样本量估算 68%(Biomni 的 3.4 倍)
  • 可复现:BioDSA 内的 MIT 代码 + Hugging Face 上 Apache 2.0 的评测数据集
  • 诚实的天花板:给药方案设计 52%、证据缺口召回 44.14%,最难的任务上仍低于专家水平

DeepEvidence 的母框架和它的姊妹 benchmark 现已收录进目录——BioDSA 在生物信息与组学分组,BioDSA-1K 在 Benchmark 与评测分组。


参考来源

DeepEvidence vs Biomni vs ToolUniverse:Nature MI 2026 | 博客