1stAuthor Papers · 曾用名 DeepXiv

每篇论文,每个章节,各一次调用。

arXiv 全文当天同步,加 PMC、bioRxiv、medRxiv。像数据库一样能过滤的混合检索,一个会读章节、用真实 ID 作答的 agentic 循环。

获取 API key → 阅读文档
$pip install deepxiv-sdk
语料
来源规模深度新鲜度
arXiv3,166,878 篇全文、分节、混合索引T+0 — 公布当天
PubMed Central约 750 万篇结构化解析,按节访问每日
bioRxiv / medRxiv预印本按节访问,同一套阅读动词每日
示例

它擅长回答的三类问题

点一个,在 playground 里打开。

渐进式阅读

分层读,别一次全读

agent 判断一份文档值不值得读,不该为整份文档付费。每一层是独立调用,便宜到可以在整个候选集上跑一遍。以下是真实数字。

一篇论文2409.05591
brief标题、TLDR、关键词、引用数、GitHub 地址
~300 tok
head章节地图,带每节 token 数——答案在哪一节
~1.7k tok
section "2. Method"一整节,干净的 markdown
5,919 tok
raw全文
23,311 tok

判断这篇论文值不值得读,花 300 token 而不是 23,311——少 78 倍。

# search → judge → read: three calls, not one 23k-token dump deepxiv search "agentic memory" --venue NeurIPS --venue-year 2025 --min-citations 50 deepxiv paper 2409.05591 --brief deepxiv paper 2409.05591 --section "2. Method"
过滤

像数据库一样过滤的检索

作者、机构、分类、会议(NeurIPS ↔ NIPS 别名自动解析)、会议年份、日期区间、最低引用数、offset 翻页、可选精排。过滤条件是 AND——窄日期窗叠高引用门槛,返回 0 条是正常的。

按社交信号看趋势

现在真正在被读的是什么——单篇论文的推文、点赞、浏览。

不止 arXiv

PubMed Central、bioRxiv、medRxiv 共用同一套阅读动词。仅开放获取。

两个 agentic 后端

arXiv 端用论文 ID 作答;web 端用缓存页面正文作答,并标出哪些页面被完整读过。

Agentic

Effort 档位

effort检索轮数首 token · arXiv首 token · web什么时候用
default1–23–4s5–9s现在就要答案
high37–8s≈13s跨论文比较
xhigh4–59–13s更久综述型问题
轮数是上限不是下限——证据够了就提前收敛。调高 effort 只增加阅读轮数,改不了第一轮召回;答案不对,先把问题问得更具体。
Papers 的信任说明

接进 agent 之前,先知道这三件事

只给 agent 一个光秃秃的 ask(query) 工具,它会用得很糟。这三条区别应该写进你的 tool description。

引用是真的

从不编造 arXiv ID、条号或案号——找不到就说没有相关结果。告诉你的 agent 在向上汇报时保留这些引用。

来源 ≠ 引用

检索十篇往往只支撑一条引用。sources 是检索集——按回答里出现的 ID 过滤,否则 agent 会把无关文档当证据摆出来。

截断会标出来,不会藏

碰到 max_answer_tokens,API 会置 answer_truncated。把它暴露出去,否则 agent 会把半截回答当完整的来总结。

给你的 agent 一些可以推理的东西

免费额度,无需绑卡。