论文
概览
live arXiv 3.13M 篇全文(章节级结构化 + 每节 TLDR)+ bioRxiv / medRxiv 检索。原 DeepXiv。
3,130,000 份文档 · id: arxiv_id 如 2409.05591 · 引用格式 [arXiv:2409.05591] · 更新于 2026-09
怎么把问题问好,比任何参数都重要。要具体——"what compression ratio does KV cache eviction report on LongBench" 远好于 "kv cache"。要数字就直接问数字。中文可以直接问。年份、会议、分类、作者、机构、最低引用数这些范围限定写进问题或 filters。结果不对就换个问法:调高 effort 只增加阅读轮数。2409.05591 的真实阅读成本:brief 约 300 token,head 约 1.7k,"2. Method" 5,919,raw 23,311。
- section 名要和 head.sections[].name 完全一致(含编号,如 '1. Introduction')。
检索
POST
/v1/papers/search混合检索,返回 brief(每条约 100–300 tok)。2 credits,
fields=head 时 3。也可 GET …/search?query=&filters=<urlencoded json>。免费样例 query:transformer、attention mechanism、large language model。| 字段 | 类型 · op | 含义 |
|---|---|---|
| source | keyword · eq arxiv | biorxiv | medrxiv | arxiv(默认)/ biorxiv / medrxiv |
| authors | keyword · eq any | 作者名,任一命中,并影响排序 |
| orgs | keyword · eq any | 机构名,任一命中,并影响排序 |
| categories | keyword · eq any | arXiv 分类,如 cs.CL |
| venues | keyword · eq any | 会议/期刊别名,如 NeurIPS、ICLR、CVPR |
| venue_year | integer · eq | 会议年份 |
| publish_at | datetime · range | 发表日期区间,YYYY / YYYY-MM / YYYY-MM-DD |
| citations | integer · range | 最小引用数(只支持 gte) |
参数
| 参数 | 类型 | 说明 | |
|---|---|---|---|
| query | string | 必填 | 1–1000 字符。也可以是最多 5 条的数组(批量,hits 变 results[])。 |
| top_k | integer | = 10 | 1–100。 |
| fields | brief | head | = brief | head 多扣 1 credit,每条附 head 视图。 |
| filters | json | 可选 | 过滤 DSL 对象(见快速开始);可用字段见上表。 |
| mode | hybrid | = hybrid | 检索模式。 |
| offset | integer | = 0 | 翻页。 |
示例
{ "domain": "papers", "query": "…", "hits": [ { "id": "2409.05591", "score": 0.83, "brief": { … } } ], "total": null, "coverage": …, "warnings": [],
"meta": { "request_id": "req_…", "credits": { "charged": 2, "balance": 1998, "pool": "allowance" }, "latency_ms": 41, "cached": false } } 用了未声明的过滤字段返回 400,不会静默忽略。过滤条件是 AND;可用
_or / _not。读一份文档
GET
/v1/papers/doc/{arxiv_id}一份文档,每次一个 view。结构化 view 在
data,文本 view 在 text 并带 token_count。免费样例:2409.05591。| view | credits | 返回 |
|---|---|---|
| brief | 1 | 标题、TLDR、关键词、日期、引用数、GitHub。~300 tok |
| head | 2 | 元数据 + 章节地图(每节 name / tldr / token 数)+ 总 token 数 |
| preview | 3 | 全文前 N 字 (text) |
| section | 3 | 一节全文,section 用 head.sections[].name (text) |
| raw | 5 | 全文 markdown (text) |
| json | 5 | 结构化全文 JSON |
| trending | 1 | X/Twitter 热度信号 |
参数
| 参数 | 类型 | 说明 | |
|---|---|---|---|
| arxiv_id (path) | string | 必填 | 文档 id(arxiv_id)。 |
| view | brief | head | preview | section | raw | json | trending | = brief | 读哪一层。 |
| characters | integer | = 10000 | view = preview,默认 10000 |
| section | string | 可选 | view = section(该 view 必填) |
示例
{ "domain": "papers", "id": "2409.05591", "view": "section", "params": { … }, "data": { … } | "text": "…", "token_count": 1834, "truncated": false, "meta": { … } } 批量读
POST
/v1/papers/docs最多 50 个 id,同一个 view。查不到的 id 返回
error: "not_found",不扣费。参数
| 参数 | 类型 | 说明 | |
|---|---|---|---|
| ids | string[] | 必填 | 文档 id 列表。 |
| view | brief | head | preview | section | raw | json | trending | = brief | 所有 id 共用的 view。 |
示例
{ "domain": "papers", "view": "brief", "docs": [ { "id": "…", "data": { … } }, { "id": "…", "error": "not_found" } ], "meta": { … } } Facets
GET
/v1/papers/facets?field={field}某个过滤字段的合法值与计数,agent 不用猜。免费。垂域未实现时 404。
参数
| 参数 | 类型 | 说明 | |
|---|---|---|---|
| field | source | authors | orgs | categories | venues | venue_year | publish_at | citations | 必填 | 过滤字段。 |
| limit | integer | = 50 | 最多返回多少个值。 |
示例
{ "domain": "papers", "field": "…", "values": [ { "value": "…", "count": 3120 } ], "meta": { … } } 问registered key+ /stream
POST
/v1/papers/ask混合检索 + 读章节 + 带真实 [arXiv:id] 引用作答;/stream 为 NDJSON。按 effort 计 50 / 100 / 200 credits。加
/stream 走 NDJSON,第一个事件一定是 billing。首个 answer_delta 之前上游失败会退款。参数
| 参数 | 类型 | 说明 | |
|---|---|---|---|
| query | string | 必填 | 1–2000 字符。问得具体;要数字就直接问数字。 |
| effort | default | high | xhigh | = default | 检索轮数上限,也决定价格:50 / 100 / 200 credits。套餐限制最高档。 |
| verbose | bool | = false | 返回工具调用轨迹(流式时多 tool_call / tool_result / thinking 事件)。 |
| top_k | integer | = 10 | 预取候选数。 |
| stream_answer | bool | = true | 仅流式:false 时只发一个 answer 事件。 |
| max_rounds | integer | 可选 | 0–8,覆盖 effort 预设。 |
| force_answer_after | number | 可选 | 秒;强制切入作答阶段。 |
| max_answer_tokens | integer | = 4096 | 触顶时置 answer_truncated。 |
| language | string | 可选 | 回答语言,默认跟随 query。 |
示例
{ "answer": "… [arXiv:2409.05591] …", "sources": [ … ], "stats": { "rounds": 1, "elapsed_s": 6.2, "answer_truncated": false }, "coverage"?: { … }, "meta": { "credits": { "charged": 50, … } } } 引用是真的——
answer 里的每个 id 都存在于本垂域(格式 [arXiv:2409.05591])。sources 是召回集,不是引用列表。answer_truncated 表示不完整。