那一条,适用它的那个案子,以及案子引用的那些条。
26 个国家的法规,带中英译文与条级抽取。中国裁判文书,带结构化 brief。双向交叉关联,分层阅读,按律师的写法给引用。
语料
| 来源 | 规模 | 深度 |
|---|---|---|
| 法规 | 26 国 · 33,103 部 · 1,537,422 条 | 原文、中/英译文、条级抽取:主体、条件、后果、关键数值、引用 |
| 中国裁判文书 | 已入库 4,510,354 → 目标 17,667,475 | 结构化 brief:案由、法院、审级、日期、争议焦点、法条、金额、判项。说理与判项按节给出 |
| 交叉关联 | 法条 ↔ 案例 | 每份判决的法律依据解析为条 ID;每条法条带引用它的案例数 |
示例
它为这三类问题而生
中文问题直接用。点一个看请求形态。
渐进式阅读
分层读,别一次全读
agent 判断一份文档值不值得读,不该为整份文档付费。每一层是独立调用,便宜到可以在整个候选集上跑一遍。以下是真实数字。
一份判决
(2022)湘0902刑初12号brief案由、法院、日期、争议焦点、引用法条、金额、判项
~100 tok
head全部结构化字段:诉请、事实、情节、说理、当事人
~400 tok
section opinion"本院认为"——法院说理原文
~600 tok
raw判决书全文
~2k tok
法条也一样:retrieve → brief → article → context → raw。刑法第 266 条本身只有约 250 字。
一部法
中华人民共和国刑法retrieve条级混合检索,返回 brief
~120 tok
brief一部法:元数据 + 章节目录
~900 tok
article一条:原文 / 译文 / 抽取 / 被引案例数
~250 tok
context前后条 + 所属章
~800 tok
raw整部法
~90k tok
过滤
按律师的检索习惯设计的过滤
法规
jurisdiction(ISO3)、law_id、law_type、domain、status、norm_type、生效日期、语言
案例
case_nature、案由、省、市、court_level、审级、日期、law_refs、金额区间、刑期月数、缓刑
Facets
GET /law/facets 与 GET /case/facets 返回每个过滤字段的合法值和计数,agent 不用猜
信任
覆盖率与偏差说明
覆盖率与偏差说明
中国刑事判决已全量索引。民事判决目前约 12%,且样本不随机——它跟着 enrichment 队列走。每个法律响应都带 coverage 块说明这一点;写进你的 tool description,让 agent 对民事案例的结论加限定。enrichment 跑完之前,民事检索结果当作参考,不当作穷举。
引用格式
法条:[中华人民共和国刑法 第266条]
案例:[(2022)湘0902刑初12号]
进度
接口已定型并写入文档,索引正在建。每个端点上线时 playground 逐个解锁。现在就能拿 key——所有垂域通用。