核心要点
- DeepEvidence 是在生物医学知识图谱上做深度研究的 AI Agent,检索对象是图谱而非网页文本
- 架构:一个 orchestrator + 两种检索模式——BFRS(广度优先)与 DFRS(深度优先)
- 4 个公开 benchmark 全部第一:HLE-Medicine 40.0%、LabBench-LitQA2 80.0%、SuperGPQA-Medicine-Hard 47.1%、TrialPanorama-EvidenceQA 96.0%
- 新构建的 7 项发现全周期任务上全面超过 Biomni 与 ToolUniverse
- 发表于 Nature Machine Intelligence(2026),代码随 BioDSA 框架发布
- 评测数据集开放:159 行,Apache 2.0,托管在 Hugging Face
DeepEvidence 是什么?
DeepEvidence 是一套面向异构生物医学知识图谱的深度研究 AI Agent 框架。
核心属性:
- 论文:Empowering biomedical evidence exploration and synthesis with deep knowledge graph research,Nature Machine Intelligence,2026
- 预印本:arXiv:2601.11560,2025 年 12 月 23 日提交
- 作者:Zifeng Wang、Zheng Chen、Ziwei Yang、Xuan Wang、Qiao Jin、Yifan Peng、Zhiyong Lu、Jimeng Sun
- 代码:作为 BioDSA 框架内 8 个 agent 之一发布
- 数据集:zifeng-ai/DeepEvidence——159 行,362 kB,Apache 2.0,纯评测用
- 知识库:工具库内 16 个
- 所有实验的底座模型:GPT-5
它针对的问题:
- 多数 deep research agent 只读互联网规模的文本语料
- 生物医学知识存在于结构化图谱中,各家 schema 互不兼容
- 跨资源实体对齐薄弱,多跳证据链因此断裂
- 工具套件庞大的通用 agent 会出现「工具混淆」——选到无关工具、走错推理路径
架构怎么运作
四个组件:
| 组件 | 职能 |
|---|---|
| Orchestrator agent | 制定研究计划,决定 BFRS/DFRS 的调用顺序与每步的研究目标 |
| BFRS agent | Breadth-First ReSearch——跨图谱广度查询,扫一跳邻域 |
| DFRS agent | Depth-First ReSearch——从 BFRS 捞出的关键实体出发做多跳追踪 |
| Evidence graph | 内部记忆,增量更新,记录实体、关系与支撑证据 |
**为什么不叫 BFS/DFS:**agent 自主选择遍历步骤,而非遵守固定的图论规则。它还能通过识别共享实体在异构图谱之间搭桥,论文称之为 bridge entities。
执行沙箱:
- Agent 写代码并执行,大规模调用知识图谱 API
- 检索结果落盘为结构化文件(如表格)
- 下游抽取与分析在同一受控环境内完成
- 一次药物查询可并行扇出到 KEGG、ChEMBL、OpenFDA 和 Open Targets
**工具库内的 16 个知识库:**BioThings、ChEMBL、ClinicalTrials.gov、Gene Ontology、Human Phenotype Ontology、KEGG、NCBI Datasets API、OpenFDA、Open Genes、ProteinAtlas、PubChem、PubTator、PubMed、Reactome、UMLS、UniProt。统一基因/药物检索工具还会额外查询 Open Targets。
实测数据:4 个公开 benchmark
所有 agent 系统使用同一底座(GPT-5),LLM 基线均配备文献检索能力。
| Benchmark | 题量 | DeepEvidence | Biomni | ToolUniverse | Sonnet-4.5 | GPT-5 |
|---|---|---|---|---|---|---|
| HLE-Medicine | 30 题 | 40.0% | 20.0% | 10.0% | 3.3% | 3.3% |
| LabBench-LitQA2 | 25 题 | 80.0% | 32.0% | 未报告 | 48.0% | 未报告 |
| SuperGPQA-Medicine-Hard | 172 题 | 47.1% | 40.7% | 未报告 | 43.6% | 未报告 |
| TrialPanorama-EvidenceQA | 50 题 | 96.0% | 84.0% | 未报告 | 88.0% | 未报告 |
「未报告」指论文正文未给出该数值。
评测集怎么构建的:
- HLE-Medicine:取 HLE 中学科标为「Medicine」的题,剔除需要图像输入的 → 30 题
- LabBench-LitQA2:从 LitQA2 子集随机抽 25 题
- SuperGPQA-Medicine-Hard:难度「Hard」∩ 领域「Clinical Medicine」→ 172 题
- TrialPanorama-EvidenceQA:取最新 50 道 EvidenceSummary 题,并把原本给定的摘要从输入中删掉,逼 agent 自己去找文献
最后这个改动信息量最大。删掉摘要后,任务从「摘要总结」变成「检索 + 推理」,96.0% 对 Sonnet-4.5 的 88.0% 是在这个更难的设定下测出来的。
实测数据:7 项发现全周期任务
作者新构建了一批任务,覆盖药物发现、临床前研究、临床试验设计和循证医学。
| 任务 | 指标 | DeepEvidence | Biomni | ToolUniverse | LLM |
|---|---|---|---|---|---|
| 靶点识别 | 准确率 | 68% | 56% | 40% | 42% |
| 作用机制与通路推理 | 准确率 | 72% | 44% | 44% | 52% |
| 体内代谢通量响应 | 准确率 | 80% | 68% | 52% | 60% |
| 样本量估算 | 准确率 | 68% | 20% | 32% | 24% |
| 给药方案设计 | 准确率 | 52% | 36% | 28% | 20% |
| 替代终点发现 | F1 | 73.3% | 60.9% | 61.9% | 58.7% |
| 证据缺口发现 | 缺口检出率 | 90.0% | 50.0% | 15.0% | 10.0% |
| 证据缺口发现 | 召回率 | 44.14% | 30.17% | 5.06% | 2.67% |
替代终点发现的完整拆解:
- DeepEvidence:精确率 73.2% / 召回率 75.0% / F1 73.3%
- Biomni:60.8% / 64.3% / 60.9%
- ToolUniverse:57.7% / 69.0% / 61.9%
- LLM:58.4% / 61.9% / 58.7%
最难的几项任务怎么造的:
- 靶点识别:解析 85 条 KEGG 人类疾病通路的 KGML 文件,构建有向信号图;真值由拓扑逻辑引擎按路径极性打分得出,而非人工标注;每题 10 个候选基因
- 样本量估算:取 TrialPanorama 样本量实例中最新的 25 个试验
- 证据缺口发现:给 agent 一篇系统综述的研究问题、目标和纳入标准,要它找出原综述遗漏的试验;按前 30 条候选打分
两个最大的差距值得单独点出来。样本量估算:68% 对 Biomni 的 20%。证据缺口检出:90.0% 对 ToolUniverse 的 15.0%。这两项的答案都只能靠真正读完大量既往试验才拿得到。
为什么它赢了 Biomni 和 ToolUniverse
论文自己给的解释落在检索深度上,与工具数量无关。
| 维度 | DeepEvidence | Biomni / ToolUniverse |
|---|---|---|
| 知识图谱 API 覆盖 | 16 个知识库 | 同样接入大量 KG API |
| 检索行为 | 结构化 BFRS→DFRS 遍历 | 搜几次就直接作答 |
| 记忆 | 持续更新的 evidence graph | 无持久化证据结构 |
| 工具选择 | 领域专用引导 | 庞大异构工具集 → 工具混淆 |
| 观察到的失败模式 | — | 检索浅、选错工具、被噪声工具输出干扰 |
| 可追溯性 | Evidence graph 可供人工审查 | 仅有推理轨迹 |
Biomni 和 ToolUniverse 本来就能访问其中大部分 API。测出来的差距来自 agent 作答前走了多少跳,以及是否把找到的东西结构化地记了下来。
该选哪个 Agent?
选型决策树:
- 证据综合、系统综述更新、试验设计 → DeepEvidence,缺口检出(90.0%)和 EvidenceQA(96.0%)是它实测最强的两条轴
- 广覆盖的通用生物医学任务 → Biomni,走的是广度路线
- 给自己的推理模型接工具层 → ToolUniverse,600+ 科研工具与 MCP server
- 自己搭生物医学 agent → BioDSA,内置 DeepEvidence 与另外 7 个已发表 agent,并提供 Claude Code / OpenClaw 技能包
- 评测假设验证类 agent → BioDSA-1K,1,029 个任务,跑在患者级 cBioPortal 数据上
按角色:
临床证据团队:
- 推荐方案:DeepEvidence
- 核心理由:新增相关试验的缺口检出率 90.0%,PubMed 检索型 LLM 只有 10.0%
- 注意:召回率 44.14%,它给的是待人工筛查的候选集,而非完整清单
药物发现团队:
- 推荐方案:DeepEvidence,用于靶点识别(68%)和机制推理(72%)
- 核心理由:推理前会先跨数据库对齐基因身份
- 注意:给药方案设计只有 52%,是七项任务里最低的
论文自陈的局限
作者对系统做不到什么写得很直接:
- 覆盖不完整——现有 benchmark 只反映生物医学研究任务的一个子集
- 依赖高质量图谱——KEGG、Gene Ontology 这类 schema 稳定、API 质量高的资源;企业自建或内部托管的图谱存在缺失值和结构不一致,需要 agent 自行构造访问工具
- 只有两种遍历策略——BFRS 与 DFRS 相比通用 agent 有明显提升,作者明说这两者不太可能是最优解
- 多项任务未达专家水平——给药方案设计 52%、证据缺口召回 44.14% 是最明显的例子
- 仅限文本模态——影像、结构生物学、蛋白质组学属于后续工作
常见问题(FAQ)
Q1:DeepEvidence 到底是什么?
DeepEvidence 是面向生物医学知识图谱的深度研究 AI Agent 框架。它用一个 orchestrator agent 调度广度优先(BFRS)和深度优先(DFRS)两类研究子 agent,并在检索全程维护一张内部 evidence graph,记录实体、关系与支撑证据。
Q2:DeepEvidence 发表在哪?
Nature Machine Intelligence(2026),标题为 "Empowering biomedical evidence exploration and synthesis with deep knowledge graph research"。预印本为 arXiv:2601.11560,2025 年 12 月 23 日提交。作者单位覆盖 Keiji AI、大阪大学、京都大学、美国国立医学图书馆(NIH/NLM)、威尔康奈尔医学院和 UIUC。
Q3:DeepEvidence 和 Biomni 比怎么样?
在同一 GPT-5 底座下,DeepEvidence 在 4 个公开 benchmark 和 7 项自建任务上全部超过 Biomni。差距最大的三项:LabBench-LitQA2 80.0% 对 32.0%,样本量估算 68% 对 20%,证据缺口检出 90.0% 对 50.0%。论文把差距归因于结构化深度遍历加 evidence graph 记忆。
Q4:DeepEvidence 开源吗?
Agent 实现随 BioDSA 框架发布在 github.com/RyanWangZf/BioDSA,MIT 协议。评测数据集在 Hugging Face 上为 zifeng-ai/DeepEvidence,Apache 2.0,159 行、7 类任务,纯评测用途。
Q5:DeepEvidence 会查哪些知识库?
16 个:BioThings、ChEMBL、ClinicalTrials.gov、Gene Ontology、Human Phenotype Ontology、KEGG、NCBI Datasets API、OpenFDA、Open Genes、ProteinAtlas、PubChem、PubTator、PubMed、Reactome、UMLS、UniProt。统一基因/药物检索工具会额外查询 Open Targets。
Q6:能在自己的数据上跑吗?
当前系统面向的是 schema 稳定、API 质量高的公开图谱。作者把企业自建或内部托管的图谱列为后续工作,需要 agent 自行构造访问工具。
Q7:DeepEvidence 和 BioDSA-1K 有什么区别?
DeepEvidence 是 agent,BioDSA-1K 是 benchmark,两者出自同一团队。DeepEvidence 做知识图谱深度研究;BioDSA-1K 用 1,029 个跑在患者级 cBioPortal 数据上的假设验证任务给 agent 打分。两者都通过 BioDSA 框架分发。
Q8:它能取代人工做系统综述吗?
证据缺口发现的召回率是 44.14%,即前 30 条候选覆盖不到一半的真阳性。它的定位是加速筛查、由人工复核,evidence graph 的存在正是为了让中间关系可被审查。
总结
DeepEvidence 把 deep research 的循环直接建在生物医学知识图谱上,而通用 deep research 系统依赖互联网规模文本。
核心结论:
- 深度压过工具数量:同一 GPT-5 底座下,结构化 BFRS→DFRS 遍历加 evidence graph 记忆,跑赢了 API 访问能力相当的 agent
- 实测最大差距:LabBench-LitQA2 80.0%(Biomni 的 2.5 倍)、证据缺口检出 90.0%(ToolUniverse 的 6 倍)、样本量估算 68%(Biomni 的 3.4 倍)
- 可复现:BioDSA 内的 MIT 代码 + Hugging Face 上 Apache 2.0 的评测数据集
- 诚实的天花板:给药方案设计 52%、证据缺口召回 44.14%,最难的任务上仍低于专家水平
DeepEvidence 的母框架和它的姊妹 benchmark 现已收录进目录——BioDSA 在生物信息与组学分组,BioDSA-1K 在 Benchmark 与评测分组。
参考来源
- Empowering biomedical evidence exploration and synthesis with deep knowledge graph research — Nature Machine Intelligence,2026
- arXiv:2601.11560 — DeepEvidence 预印本
- zifeng-ai/DeepEvidence — 评测数据集
- RyanWangZf/BioDSA — 框架与 agent 实现
- arXiv:2505.16100 — BioDSA-1K benchmark
