每篇论文,每个章节,各一次调用。
arXiv 全文当天同步,加 PMC、bioRxiv、medRxiv。像数据库一样能过滤的混合检索,一个会读章节、用真实 ID 作答的 agentic 循环。
语料
| 来源 | 规模 | 深度 | 新鲜度 |
|---|---|---|---|
| arXiv | 3,166,878 篇 | 全文、分节、混合索引 | T+0 — 公布当天 |
| PubMed Central | 约 750 万篇 | 结构化解析,按节访问 | 每日 |
| bioRxiv / medRxiv | 预印本 | 按节访问,同一套阅读动词 | 每日 |
示例
它擅长回答的三类问题
点一个,在 playground 里打开。
渐进式阅读
分层读,别一次全读
agent 判断一份文档值不值得读,不该为整份文档付费。每一层是独立调用,便宜到可以在整个候选集上跑一遍。以下是真实数字。
一篇论文
2409.05591brief标题、TLDR、关键词、引用数、GitHub 地址
~300 tok
head章节地图,带每节 token 数——答案在哪一节
~1.7k tok
section "2. Method"一整节,干净的 markdown
5,919 tok
raw全文
23,311 tok
判断这篇论文值不值得读,花 300 token 而不是 23,311——少 78 倍。
# search → judge → read: three calls, not one 23k-token dump deepxiv search "agentic memory" --venue NeurIPS --venue-year 2025 --min-citations 50
deepxiv paper 2409.05591 --brief deepxiv paper 2409.05591 --section "2. Method"
过滤
像数据库一样过滤的检索
作者、机构、分类、会议(NeurIPS ↔ NIPS 别名自动解析)、会议年份、日期区间、最低引用数、offset 翻页、可选精排。过滤条件是 AND——窄日期窗叠高引用门槛,返回 0 条是正常的。
按社交信号看趋势
现在真正在被读的是什么——单篇论文的推文、点赞、浏览。
不止 arXiv
PubMed Central、bioRxiv、medRxiv 共用同一套阅读动词。仅开放获取。
两个 agentic 后端
arXiv 端用论文 ID 作答;web 端用缓存页面正文作答,并标出哪些页面被完整读过。
Agentic
Effort 档位
| effort | 检索轮数 | 首 token · arXiv | 首 token · web | 什么时候用 |
|---|---|---|---|---|
| default | 1–2 | 3–4s | 5–9s | 现在就要答案 |
| high | 3 | 7–8s | ≈13s | 跨论文比较 |
| xhigh | 4–5 | 9–13s | 更久 | 综述型问题 |
轮数是上限不是下限——证据够了就提前收敛。调高 effort 只增加阅读轮数,改不了第一轮召回;答案不对,先把问题问得更具体。
Papers 的信任说明
接进 agent 之前,先知道这三件事
只给 agent 一个光秃秃的 ask(query) 工具,它会用得很糟。这三条区别应该写进你的 tool description。
引用是真的
从不编造 arXiv ID、条号或案号——找不到就说没有相关结果。告诉你的 agent 在向上汇报时保留这些引用。
来源 ≠ 引用
检索十篇往往只支撑一条引用。sources 是检索集——按回答里出现的 ID 过滤,否则 agent 会把无关文档当证据摆出来。
截断会标出来,不会藏
碰到 max_answer_tokens,API 会置 answer_truncated。把它暴露出去,否则 agent 会把半截回答当完整的来总结。