论文

概览

live arXiv 3.13M 篇全文(章节级结构化 + 每节 TLDR)+ bioRxiv / medRxiv 检索。原 DeepXiv。

3,130,000 份文档 · id: arxiv_id2409.05591 · 引用格式 [arXiv:2409.05591] · 更新于 2026-09

怎么把问题问好,比任何参数都重要。要具体——"what compression ratio does KV cache eviction report on LongBench" 远好于 "kv cache"。要数字就直接问数字。中文可以直接问。年份、会议、分类、作者、机构、最低引用数这些范围限定写进问题或 filters。结果不对就换个问法:调高 effort 只增加阅读轮数。2409.05591 的真实阅读成本:brief 约 300 token,head 约 1.7k,"2. Method" 5,919,raw 23,311。

  • section 名要和 head.sections[].name 完全一致(含编号,如 '1. Introduction')。

读一份文档

GET/v1/papers/doc/{arxiv_id}
一份文档,每次一个 view。结构化 view 在 data,文本 view 在 text 并带 token_count。免费样例:2409.05591
viewcredits返回
brief1标题、TLDR、关键词、日期、引用数、GitHub。~300 tok
head2元数据 + 章节地图(每节 name / tldr / token 数)+ 总 token 数
preview3全文前 N 字 (text)
section3一节全文,section 用 head.sections[].name (text)
raw5全文 markdown (text)
json5结构化全文 JSON
trending1X/Twitter 热度信号

参数

参数类型说明
arxiv_id (path) string 必填 文档 id(arxiv_id)。
view brief | head | preview | section | raw | json | trending = brief 读哪一层。
characters integer = 10000 view = preview,默认 10000
section string 可选 view = section(该 view 必填)

示例

{ "domain": "papers", "id": "2409.05591", "view": "section", "params": { … }, "data": { … } | "text": "…", "token_count": 1834, "truncated": false, "meta": { … } }

批量读

POST/v1/papers/docs
最多 50 个 id,同一个 view。查不到的 id 返回 error: "not_found",不扣费。

参数

参数类型说明
ids string[] 必填 文档 id 列表。
view brief | head | preview | section | raw | json | trending = brief 所有 id 共用的 view。

示例

{ "domain": "papers", "view": "brief", "docs": [ { "id": "…", "data": { … } }, { "id": "…", "error": "not_found" } ], "meta": { … } }

Facets

GET/v1/papers/facets?field={field}
某个过滤字段的合法值与计数,agent 不用猜。免费。垂域未实现时 404。

参数

参数类型说明
field source | authors | orgs | categories | venues | venue_year | publish_at | citations 必填 过滤字段。
limit integer = 50 最多返回多少个值。

示例

{ "domain": "papers", "field": "…", "values": [ { "value": "…", "count": 3120 } ], "meta": { … } }

registered key+ /stream

POST/v1/papers/ask
混合检索 + 读章节 + 带真实 [arXiv:id] 引用作答;/stream 为 NDJSON。按 effort 计 50 / 100 / 200 credits。加 /stream 走 NDJSON,第一个事件一定是 billing。首个 answer_delta 之前上游失败会退款。

参数

参数类型说明
query string 必填 1–2000 字符。问得具体;要数字就直接问数字。
effort default | high | xhigh = default 检索轮数上限,也决定价格:50 / 100 / 200 credits。套餐限制最高档。
verbose bool = false 返回工具调用轨迹(流式时多 tool_call / tool_result / thinking 事件)。
top_k integer = 10 预取候选数。
stream_answer bool = true 仅流式:false 时只发一个 answer 事件。
max_rounds integer 可选 0–8,覆盖 effort 预设。
force_answer_after number 可选 秒;强制切入作答阶段。
max_answer_tokens integer = 4096 触顶时置 answer_truncated。
language string 可选 回答语言,默认跟随 query。

示例

{ "answer": "… [arXiv:2409.05591] …", "sources": [ … ], "stats": { "rounds": 1, "elapsed_s": 6.2, "answer_truncated": false }, "coverage"?: { … }, "meta": { "credits": { "charged": 50, … } } }
引用是真的——answer 里的每个 id 都存在于本垂域(格式 [arXiv:2409.05591])。sources 是召回集,不是引用列表。answer_truncated 表示不完整。