热心市民王先生

AskChem

#论文解读 #Hugging Face #化学信息学 #科学文献检索

基于 Hugging Face Daily Papers 2026-07-31 榜首论文,深入解读 AskChem 如何把化学文献检索单位从整篇论文改为带 DOI 与原文证据的原子化主张,并以分面分类、证据图谱和 MCP 接口支撑可核验的跨论文综合。

自动研究时间:2026-08-01 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Jul 31,列表最顶部为 AskChem;详情页标注 #1 Paper of the day
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv HTML 完整论文(含附录与实验表)-> 官方系统、代码与数据链接交叉核对。

执行摘要

传统学术搜索把“论文”当作最小检索单位,但化学研究者真正需要的往往是散落在许多论文中的具体发现:某种催化剂在什么条件下把 CO₂ 还原成什么产物、法拉第效率是多少、另一项工作是否支持或反驳这个结果。搜索系统返回十几篇相关论文后,定位证据、核对出处和横向整理仍由人或下游 AI 完成。

AskChem 把检索单位从论文改成 provenance-carrying claim(带来源证据的主张)。每条 claim 是从论文中抽取的原子化、类型化科学陈述,至少绑定 claim 类型、来源 DOI,以及逐字引文或明确的全文证据定位;反应物、产物、条件、测量值等字段则以结构化形式保存。这样,检索结果不再只是“可能相关的文章”,而是可以直接用于综合、又能回到原文核验的证据单元。

系统在同一 claim store 上叠加三种互补结构:用于生产检索与浏览的稳定分面分类体系、连接 supports/contradicts/extends 等关系的证据图谱,以及按原理、理论、模型和机制组织文献的探索性 Living Taxonomy。当前在线索引覆盖 14.7 万篇论文、240 万条 claim、30.7 万个已填充分面节点和约 17.1 万条证据边,并通过 Web、REST、SDK 与 MCP 向人和 Agent 暴露相同对象。

在包含 30 个跨论文化学问题的 AskChem-Bench 上,GPT-5.5 单独回答时,引用 DOI 的可解析率为 88.3%;接入 AskChem 后达到 100%,平均每个答案包含 18.1 个经核验 DOI,也是五种设置中引用密度最高的一项。AskChem 的平均论文相关性为 2.15/3,近期高影响论文覆盖率为 18.5%,两项均居首。但 Edison Scientific 在“带引文的量化细节”和 on-topic 比率上更高,说明 AskChem 更突出的优势是开放、可核验、可复用的检索基础设施,而不是在所有答案质量维度上压倒闭源深度研究 Agent。

这篇论文最值得肯定的地方,是把“检索增强”从给 LLM 塞更多文档,推进到设计稳定、可追踪的科学证据接口。不过证据可追踪不等于语义正确:claim、关系与分类位置仍由 LLM 生成;核心 benchmark 只有 30 道题;分面分类对检索的独立增益尚未消融;Living Taxonomy 也没有完成专家级验证。因此,AskChem 适合被视为文献发现与证据导航层,而不是自动化化学结论的权威来源。

1. 论文基本信息

项目内容
论文标题AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
论文编号arXiv:2607.28618
arXiv 版本v1,2026-07-30 提交
Hugging Face 状态2026-07-31 Daily Papers 榜首,#1 Paper of the day
作者Bing Yan、Gregory Wolfe、Stefano Martiniani、Kyunghyun Cho
研究机构New York University、Matterstack, Inc.
学科分类Computation and Language(cs.CL)、Artificial Intelligence(cs.AI)、Information Retrieval(cs.IR)、Machine Learning(cs.LG)
研究对象化学文献综合、claim-level retrieval、证据图谱、科学 Agent 工具
系统规模147K papers、2.4M claims、307K taxonomy nodes、171,342 evidence edges
开放资源在线系统;MIT 许可代码;CC-BY 索引快照;REST、SDK 与 MCP 接口

核心链接:

2. 背景与动机:为什么“找到论文”还不是“找到证据”

2.1 文档检索与科学综合之间的断层

Google Scholar、Semantic Scholar 及常见 RAG 管线通常围绕标题、摘要或全文片段排序文档。对于“哪些电催化剂可以把 CO₂ 还原成 CO,它们各自的法拉第效率是多少”这类问题,一份可靠答案至少需要完成四步:

  1. 找到分散在不同论文中的候选结果;
  2. 从每篇论文中定位催化剂、反应条件和量化指标;
  3. 核对陈述是否真的得到原文支持,并确认 DOI 可解析;
  4. 比较结果之间的支持、延伸或冲突关系。

文档搜索只主要解决第一步。把排名靠前的论文交给 LLM 并不能自动保证后三步:模型可能遗漏局部证据、混合不同实验条件,或根据参数记忆生成形式合理但不存在的引用。

2.2 从“文献目录”转向“证据接口”

AskChem 的关键判断是:跨论文综合所需的原子单位不是 paper,而是能独立验证的 claim。理想的 claim 同时满足:

  • 足够小:只表达一个主要科学断言;
  • 有类型:能区分反应、测量、机制、限制等不同语义角色;
  • 可计算:反应物、催化剂、产物、条件和结果可以结构化检索;
  • 可追踪:始终绑定 DOI 与逐字引文,或全文中的明确证据位置;
  • 可连接:能与其他论文的 claim 建立支持、反驳、扩展和来源关系。

这不是简单地把论文切成 chunk。普通 chunk 主要保留局部文本,claim 则增加了语义类型、结构化字段、稳定身份与来源约束,使同一个证据对象可以同时被搜索、分组、挂入分类树和连接进图谱。

3. 核心贡献

3.1 以 claim 为中心的统一数据模型

AskChem 定义的核心对象包括:

对象作用关键字段
Claim最小检索与综合单元claim type、source DOI、verbatim quote/evidence locator、结构化化学字段、置信度
Source保存论文级来源信息DOI、作者、年份、venue、引用数、OpenAlex 消歧信息
TreeNode把 claim 放入一个或多个层级路径分面、L1/L2/L3 路径、节点计数
Edge连接两条 claim有向关系类型、置信度、关系证据与来源

所有结构都锚定同一个 claim ID。搜索、层级浏览和图遍历因而返回同一批带 provenance 的对象,避免“搜索摘要”“知识图节点”和“引用来源”彼此脱节。

3.2 两级抽取管线兼顾覆盖率与深度

系统使用两条互补管线:

  • 高吞吐摘要抽取:GPT-5-mini 读取标题与摘要,面向大规模索引;
  • 深度全文抽取:Gemini 3.1 Pro 通过 Vertex AI Batch 原生读取 PDF,补充假设、局限与反直觉发现等摘要中常缺失的类型。

一个小型历史切片来自旧的 GPT-4o / GPT-4o-mini 管线。所有抽取调用都要求 JSON object 约束输出;解析失败或 schema 校验失败会自动重试。结构校验覆盖必需 provenance、数值范围和化学字段,但作者明确区分了两件事:格式与来源完整性可以自动检查,科学语义是否被正确解释仍不能由 schema 保证。

3.3 三种结构服务不同的检索需求

结构回答的问题生产定位
稳定分面分类这条 claim 关于什么反应、物质、应用、技术或机制检索召回、分组、浏览、时间视图
证据图谱其他论文如何支持、延伸、引用或反驳它关系导航、冲突发现、证据链
Living Taxonomy哪个原理、理论、模型、机制或现象支配这项贡献探索性全局地图,不宣称是完成验证的本体

这个拆分很重要。作者没有强迫一棵树同时承担“好搜索”和“科学解释”两种目标:分面分类强调稳定、可运营;Living Taxonomy 强调原理导向、允许演化;证据图谱处理树结构不擅长的多对多关系。

3.4 人与 Agent 共用同一基础设施

AskChem 不只展示一个搜索网页,还提供 REST API、SDK 和 MCP server。典型端点包括:

GET /api/search?q=CO2+reduction
GET /api/claims/{claim_id}
GET /api/claims/{claim_id}/neighborhood
GET /api/sources/{doi}

搜索返回 claim ID 与分类路径;claim 查询暴露原文证据;neighborhood 返回入边和出边;source 查询汇总某篇论文的所有已索引 claim。Agent 由此可以先召回证据,再沿关系扩展,最后逐条回溯来源,而不是把引用核验当成回答生成后的补救步骤。

4. 方法详解

4.1 claim 表示:把科学陈述变成可核验记录

论文给出的真实索引记录包含如下信息:

  • claim_type: reaction
  • 来源 DOI:10.1002/anie.201914977
  • 反应类型:电催化 CO₂ 还原为 CO;
  • 反应物与角色:CO₂ 是 substrate,Ni SA-N2-C 是 catalyst;
  • 产物:CO;
  • 结果:CO 法拉第效率 98%,turnover frequency 1622 h⁻¹;
  • 与上述结果对应的逐字引文;
  • by_reaction_type 等多个分类路径。

对于无法用一段连续引文表示的全文 claim,系统改用 evidence_locator,记录论文位置与结构化证据。其设计原则不是要求每个发现都能压缩成一句原文,而是任何对外暴露的 claim 都必须有可回查位置。

4.2 稳定分面分类:从语料诱导,再做生产化归一

AskChem 在消化论文和抽取 claim 时诱导分类路径,然后通过三步稳定化:

  1. 把顶层路径路由到规范 L1 类别;
  2. 合并同义表达;
  3. 对近重复子类进行模糊聚类。

最终路径通常包含 2–5 个 segment,例如 coupling/cross_coupling/suzuki。五个内容视图覆盖 reaction、substance、application、technique 和 mechanism;claim type、measurement、time 与 author 再提供互补视角。

底层 hybrid search 组合:

  • SQLite FTS5 的 claim 文本召回;
  • 论文级召回;
  • taxonomy node 召回;
  • dense vector 召回;
  • Reciprocal Rank Fusion(RRF)合并排序。

这里的分类树不只是可视化标签,而是召回信号本身。命中的 claim 仍携带其路径,客户端可以按反应、技术或时间分组,并从结果反向进入层级浏览。

4.3 证据图谱:让“相关”细分为可解释关系

第二遍关系抽取生成带方向的五类边:

  • cites_as_evidence:一项工作把另一项结果当作证据;
  • supports:结果支持另一条 claim;
  • extends:工作扩展既有发现;
  • contradicts:发现之间存在冲突;
  • derives_from:主张从前项方法或结果派生。

当前图谱含 171,342 条边。领域专家作者分层抽样审核 148 条,其中 2 条无法判定;在剩余 146 条中有 143 条关系类型正确,对应 97.9% edge-type precision

这项结果有实际意义,也必须正确解读:它验证的是抽样边的“关系类型”是否正确,不等于图谱召回率高、不等于所有 claim 正确,也不代表任意路径都能构成严谨的因果证据链。

4.4 Living Taxonomy:允许“不知道放在哪里”

Living Taxonomy 以 principles、theories、models、mechanisms 和 phenomena 为内部节点,把论文支持的叶子挂在更广的科学思想下。当前树有 4,931 个节点,覆盖约 110 万条 claim 和 36.1 万次 paper placement;同一论文可在多个视图中出现,因此 placement 数不等于唯一论文数。

模型若找不到合适宿主,可以 abstain 并提出新分支。当前有 663 个开放提议分支。这一机制比强行投到最近邻节点更符合开放科学知识的增长方式,但论文也把它定位为 exploratory overview:专家对 placement 的系统验证仍是未来工作。

4.5 存储与服务架构

索引主体存储在 SQLite,全文检索使用 FTS5,同时维护向量索引;FastAPI 向网页与 Agent 接口提供统一服务。这个选择强调的是可复制性和交付效率:240 万 claim 的系统并没有要求专用分布式图数据库才能运行。

但论文未给出延迟分位数、并发吞吐、索引构建成本、存储体积或增量更新时延。所谓“corpus scale”在本文中主要由可联合查询的数据规模证明,并不是完整的线上系统性能评测。

5. 实验设计

5.1 四个研究问题

论文围绕系统主张设计四个 RQ:

研究问题验证对象主要证据
RQ1claim 是否能回溯来源240 万 claim 的 provenance 字段覆盖率
RQ2claim-level 结构是否可靠、可用证据边专家抽检;分面分类用于线上检索
RQ3claim-centered retrieval 是否改善跨论文综合AskChem-Bench 五种设置对比
RQ4系统能否在语料规模运行统一接口查询 claims、taxonomy nodes 与 evidence edges

5.2 AskChem-Bench

AskChem-Bench v1.1 共 30 道跨论文化学问题,每类十题:

  • condition aggregation:汇总不同论文中的材料、条件和测量结果;
  • temporal tracking:追踪方法或发现随时间的演化;
  • contradiction surfacing:寻找证据之间的潜在冲突。

五种回答设置均覆盖全部 30 题:

  1. GPT-5.5 不接检索;
  2. GPT-5.5 + AskChem;
  3. GPT-5.5 + Paperclip;
  4. Edison Scientific 的 PaperQA-family Agent;
  5. Google NotebookLM Deep Research。

AskChem 先把每题改写成 3–4 个关键词子查询,并行执行 hybrid search,合并、去重并多样化为最多 40 条 claim,再交给相同 reader 做 grounded synthesis。所有提取出的 DOI 都通过 CrossRef 核验。

论文用 Gemini 3.1 Pro 评估相关性;在 100 条领域专家标签上的一致率为 93%,Cohen’s (\kappa=0.914)。自动裁判得到较好校准并不消除 judge bias,尤其各系统可提供的证据粒度不同:AskChem 按 claim 判定,论文级系统按引用标题和摘要判定。

5.3 指标含义

指标解释不能说明什么
DOI existence被引用 DOI 能否在 CrossRef 解析引用是否真正支持陈述
Citation density每个答案的已核验 DOI 数答案是否简洁、是否重复引用
Grounded specificity带引用的量化细节数量量化值是否全面、实验条件是否可比
Recent high-impact对近期高影响工作的覆盖率对经典或长尾证据的覆盖质量
Paper relevance0–3 分的平均相关性claim 的科学正确性
On-topic ≥ 2相关性至少 2 分的比例答案整体逻辑与结论质量

6. 实验结果

6.1 AskChem-Bench 五系统对比

指标LLM only+AskChem+PaperclipEdison ScientificNotebookLM
DOI existence88.3%100%100%99.1%93.7%
Citation density / answer9.618.17.510.77.9
Grounded specificity8.15.90.529.20.1
Recent high-impact0.6%18.5%6.1%11.3%12.1%
Paper relevance(0–3)1.662.151.722.071.84
On-topic ≥ 265.8%86.6%57.8%89.7%78.9%

AskChem 最强的结果是把 DOI 可解析率从 88.3% 提到 100%,同时不是靠少引文规避错误:平均引用密度反而从 9.6 增至 18.1。论文展示的一道 CO₂ 还原题中,GPT-5.5 单独回答给出的 14 个 DOI 有 6 个无法解析;接入 AskChem 后,22 个 DOI 全部可解析,具体结果直接来自来源摘要。

但结果并不支持“AskChem 全面优于其他科学 Agent”。Edison Scientific 的 grounded specificity 为 29.2,远高于 AskChem 的 5.9,on-topic 比率也以 89.7% 略高于 86.6%。AskChem 的比较优势是:

  • DOI 完整性与较高相关性同时成立;
  • 数据、代码和接口开放;
  • claim 可在搜索、分类与图谱之间复用;
  • 适合交互式查询和 Agent 工具调用,而非只能输出一次性报告。

6.2 来源完整性不是事实正确率

索引中 100% 的 claim 都包含 claim type、source DOI 和 verbatim quote,说明自动 gate 能阻止无来源记录进入索引。然而,这个 100% 只回答“能不能定位出处”,没有回答:

  • claim 是否忠实概括了引文;
  • 数值与实验条件是否正确绑定;
  • 是否遗漏否定词、限定条件或不确定性;
  • 来源论文自身的结论是否可靠。

把 provenance coverage 写成“100% 准确”会严重误读论文。AskChem 的架构价值恰恰在于:当自动抽取可能出错时,使用者仍有明确路径回到原始证据。

6.3 结构可靠性证据仍不均衡

证据图谱有 97.9% 的边类型抽检精度,是目前结构层最直接的专家评估。相比之下:

  • 分面分类虽已进入生产召回,但没有单独报告它对 recall、nDCG 或最终答案的净增益;
  • 未报告专家对 taxonomy placement 的系统准确率;
  • Living Taxonomy 只有设计示例和覆盖统计,没有完整专家验证。

因此,“证据边类型初步可靠”有数据支持;“整套自动知识组织已被充分验证”则没有。

6.4 规模成立,系统性能证据不足

同一个 REST schema 能查询 240 万 claims、30.7 万 taxonomy nodes 和 17.1 万 evidence edges,证明架构不是只在小样例上运行。可惜论文没有给出:

  • p50/p95/p99 查询延迟;
  • 并发用户与吞吐;
  • 批量摄取和增量更新成本;
  • 全文抽取与摘要抽取的覆盖比例;
  • 端到端构建的模型调用与云计算费用。

这些指标对研究原型不是必需项,但会决定其他团队能否在更大或更专门的语料上复现。

7. 局限与批判性分析

7.1 语料覆盖仍是“化学的一小部分”

14.7 万篇论文和 240 万 claim 在工程上很大,但相对整个化学文献体系仍有限。语料选择会直接决定分类结构、知识空白和答案偏差。论文没有给出各子领域、出版商、年份和开放获取状态的完整覆盖分布。

7.2 摘要抽取与全文抽取不等价

高吞吐管线主要从标题与摘要提取。摘要通常省略负结果、详细条件、误差、消融与局限,因而即使 claim 逐字忠于摘要,也可能不足以支持实验复现或严肃比较。全文抽取更深,但论文未说明 14.7 万篇中有多少进入了全文管线。

7.3 LLM 生成的 claim、边与分类都可能错

JSON schema 可以验证字段存在,不能验证化学语义。关系抽样结果虽好,但 148 条相对 171,342 条边仍很小;而抽样由领域专家作者完成,若有独立、多标注者盲审会更有说服力。

7.4 Benchmark 规模和评价面偏窄

30 道题能用于端到端演示,难以覆盖有机合成、材料、药物、物化等不同子领域的检索难点。主要结论集中于引用可解析率、密度与相关性,并未直接评估:

  • 最终科学陈述的事实准确率;
  • 条件与测量值的结构化一致性;
  • 矛盾是否真实而非实验条件差异;
  • 研究者完成任务所需时间;
  • 用户是否能更快发现错误并修正答案。

7.5 系统对比并非完全同构

AskChem 暴露 claim,Paperclip 等系统暴露论文,Edison Scientific 还是闭源 agentic deep-research 系统。虽然 reader 和问题集合尽量统一,但证据预算、内部搜索策略和可观察内容并不相同。表 1 更适合说明不同系统的能力轮廓,而不是纯粹的检索算法排行榜。

7.6 字符串归一与 taxonomy drift

作者承认字符串式分类归一可能错误合并不同概念,也可能保留近重复节点。Living Taxonomy 会提出新分支,却没有展示版本治理、节点合并、历史链接迁移和人工审核队列如何长期运作。对“living”系统而言,持续维护机制与初次构建同样重要。

8. 应用影响

8.1 化学综述与证据表自动化

研究者可以按反应、催化剂、条件和测量字段直接汇总 claim,再逐项回到 DOI 与引文核验。它特别适合先生成“可审计的候选证据表”,再由专家进行筛选,而不是直接代写定论。

8.2 科学 Agent 的检索工具层

MCP 和 REST 接口让 Agent 能执行更明确的工具流程:搜索 claim、展开证据邻域、读取来源、检查冲突、最后生成引用。这比把搜索结果拼进上下文后一次回答,更容易做程序化校验和失败恢复。

8.3 假设形成与矛盾发现

证据图谱可把散落论文中的支持、延伸和冲突关系显式化。真正高价值的用途不只是“找更多文献”,而是发现不同材料、条件或实验协议下看似矛盾的结果,并提示研究者重新检查可比性。

8.4 迁移到其他科学领域

claim + provenance + operational facets + evidence graph 的总体架构可迁移到生物医学、材料科学或临床指南,但 schema、关系类型、证据标准和领域本体必须重新设计。AskChem 的化学字段和分类不能直接当作通用科学知识模型。

8.5 高风险决策中的正确角色

AskChem 不应替代原始论文阅读、实验复核或安全评估。更合理的责任边界是:

环节系统适合承担仍需专家承担
文献发现大规模候选 claim 召回与分类浏览判断语料是否遗漏关键来源
证据整理聚合数值、条件、来源与关系确认实验条件可比、解释限定语
引用核验检查 DOI、展示逐字引文或 locator判断引文是否真正支持结论
结论生成草拟可追踪综合与冲突清单对科学结论、实验与安全负责

9. 相关工作

9.1 化学数据库与学术搜索

类别代表系统优势AskChem 的差异
专有化学数据库Reaxys、SciFinder高质量反应与物质数据、专业工作流AskChem 开放,并关注带原文来源的叙述性 claim
开放结构数据库PubChem、ChEMBL分子、生物活性等标准化结构数据AskChem 处理跨论文自然语言发现与证据关系
通用学术搜索Google Scholar、Semantic Scholar论文覆盖广、引用与元数据丰富AskChem 把检索结果下沉到 claim 级并绑定引文

AskChem 不是要取代成熟化学数据库。前者擅长从文献叙述中抽取、连接和核验发现;后者往往在结构化实体规范、专业检索规则与人工策展深度上更强。

9.2 科学 NLP、RAG 与深度研究 Agent

系统继承了几条既有技术线:科学信息抽取与关系抽取、自动 taxonomy induction、Sentence-BERT 式语义检索、RAG 和 RRF 排序。与 PaperQA、NotebookLM、Paperclip 或 Edison Scientific 等“输入问题、输出综合答案”的系统相比,AskChem 更强调持久化中间层:claim store 本身可以被不同 UI、Agent 和后续任务重复使用。

这种定位带来一个重要取舍:AskChem 把更多工程投入放在 evidence object、索引和 provenance 上,未必在单次答案中生成最多细节;深度研究 Agent 可以为一道问题投入更多检索与推理预算,却不一定把其中间证据结构开放为可复用公共基础设施。

9.3 与普通 RAG 的本质区别

维度常见文档/片段 RAGAskChem
基本单位文档或固定长度 chunk原子化、类型化 claim
来源约束通常保留文档 ID 或 URLDOI + verbatim quote/evidence locator 为必需字段
结构化字段可选 metadata反应、物质、条件、测量等领域字段
跨文献关系多由生成模型临时推断持久化 typed evidence edges
分类组织标签或向量邻域稳定分面分类 + 探索性原理树
Agent 接口检索后返回文本块搜索、claim、neighborhood、source 分层查询

10. 复现与落地建议

对希望在其他领域复现该路线的团队,建议优先验证以下顺序:

  1. 先定义 claim schema 与可接受的最小 provenance,不要从生成答案界面开始;
  2. 建立人工标注的小型金标准集,分别评估抽取、字段绑定、关系与分类位置;
  3. 区分“生产检索分面”和“解释性知识体系”,避免一棵自动 taxonomy 承担所有目标;
  4. 让系统可以 abstain,把低置信结果进入人工审核队列;
  5. 在答案指标之外,测量检索 recall、错误发现时间、专家校验成本与真实任务完成率;
  6. 对版本、claim 更新、节点合并和来源撤稿建立可追踪策略;
  7. 最后才接入 Agent 与 MCP,确保工具返回的是已经过明确 gate 的证据对象。

11. 结论

AskChem 的核心贡献不是又做了一个“能和论文聊天”的界面,而是重新定义科学检索系统交付给人和 Agent 的最小对象。把 claim、DOI、原文证据、分类路径和跨论文关系绑定在一起,使引用核验从生成后的附加步骤变成数据层的基本约束。

实验表明,这种设计能显著改善跨论文回答的引用完整性:在 30 题 benchmark 上达到 100% DOI 可解析率和最高引用密度,同时保持较高相关性。开放的代码、数据、API 和 MCP 也让它比一次性答案系统更具基础设施价值。

但现阶段最稳妥的结论是“AskChem 提供了更好的可审计文献综合底座”,而不是“自动抽取已经等同专家知识库”。语义正确率、taxonomy 的独立价值、跨子领域覆盖、用户效用和线上成本仍需更大规模验证。对科学工作流而言,真正可取的方向不是让模型替代查证,而是让每一条机器生成的科学陈述都更容易被查证。

参考资料

  1. Hugging Face Papers:https://huggingface.co/papers/2607.28618
  2. Yan, B., Wolfe, G., Martiniani, S., & Cho, K. AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis:https://arxiv.org/abs/2607.28618
  3. arXiv HTML 全文:https://arxiv.org/html/2607.28618v1
  4. AskChem 在线系统:https://askchem.org
  5. AskChem GitHub 仓库:https://github.com/bingyan4science/askchem
  6. AskChem CC-BY 索引快照:https://huggingface.co/datasets/bing-yan/askchem
  7. AskChem OpenAPI 文档:https://askchem.org/api/docs
  8. AskChem-Bench:https://askchem.org/api/benchmark