Citation 与原文核验
用户读到综述中的某个判断,需要知道它来自哪篇论文,必要时打开原文检查。继续要求“缩短背景介绍,保留引用”时,这条关联也应随正文留下来。Lito 把引用做成回答的一部分,同时保存可用于查找原件的来源关系。
一、引用与来源关联
搜索工具向模型提供编号证据,模型在论述中引用这些编号,系统保存回答与来源的对应关系。正文将引用显示为可点击的文章标题标签,较长的标题缩短显示。标签会清理导入文件名中的序号、作者年份前缀和扩展名,便于用户辨认论文,再打开详情或 PDF。
系统仍使用编号维护引用映射。每条回答按来源首次出现的顺序从 1 编号,重复引用同一来源时复用编号;正文标签负责展示,文档和页码标识负责定位。流式生成、刷新页面和重新打开会话采用对应的编号整理规则。
来源列表按论文合并展示,同一 PDF 的多个证据页不会重复占据列表。正文引用仍保留各自的证据位置:同一论文的不同页面显示相同的标题标签,点击后定位到对应页面。
来源详情展示完整标题和可用页码。用户停留在引用标签上时,系统会查找对应的原文依据:定位成功后显示简短摘录,查找过程中显示加载状态。浮层预览限制在 220 字符、最多四行,完整依据在 PDF 阅读区查看。
Lito 保留两种引用粒度:检索路径通常指向文件,直接放入上下文的 PDF 则可以逐页编号。逐页读取时,程序从原 PDF 获取物理页序,来源形如 file_id#pdf-page=4,并携带 pdf_page。即使中间一页没有文字,后续页面也保留原始序号。
| 引用携带的信息 | 点击后如何使用 |
|---|---|
| 文件标识 | 找到当前用户可以访问的原始 PDF |
可靠的 pdf_page |
打开对应物理页;与论文正文印刷页码分开理解 |
| 紧邻引用的直接引句 | 在指定页或整个 PDF 内查找原文,并尝试高亮 |
| 概括性论述与可靠页码 | 模型在对应页选择支持段落,经原文位置核对后展示 |
引用密度通过生成规则控制:归属清楚的连续论述可以在段末合并同一来源,具体数字、直接引文和不同研究分别保留依据。改写过程中,模型调整引用的组织方式,前端展示返回的正文与引用。
二、原文定位与高亮
用户悬停查看来源或打开 PDF 时,系统会结合文件、页码和引用附近的内容查找依据。前端既提取紧邻引用的直接引句,也提取引用前的当前论述,供后续定位使用。
系统先尝试匹配直接引句。匹配时统一字符形式与大小写,忽略标点、空格和换行,再检查连续文字是否唯一出现。有可靠页码时查找指定页,否则可以在 PDF 中查找引句。
如果直接匹配没有成功,但引用带有可靠页码和当前论述,模型会阅读对应页,选择最多三段能够支持这句话的原文。例如,正文是中文概括、论文是英文时,模型选取英文原句。随后程序再次核对每段文字是否在该页唯一出现,全部通过后才生成高亮。
模型负责选择相关依据,程序负责确认文字及其位置。高亮坐标按页面比例保存,缩放后仍能贴合原文。查找结果按用户、文件内容、页码、引句和本次论述缓存,重复查看可以复用;相关内容变化后会重新查找。每次请求仍先检查文件访问权限。
| 定位结果 | 用户看到什么 |
|---|---|
matched |
对应页面与原文高亮 |
ambiguous |
提示存在多个匹配,保留 PDF 阅读,不选定其中一处 |
missing_quote / not_found |
没有可用引句或未找到匹配,仍可查看页面 |
unsupported_claim |
未找到可确认的支持段落,仍可阅读来源页 |
no_text / unsupported_rotation |
说明文字提取或页面旋转限制,不绘制未经确认的高亮 |
这一过程在用户查看引用时触发。模型选取范围是引用对应页;没有可靠页码时,概括性论述仍通过打开论文核对。matched 表示选取文字的位置已确认,不代表论断的含义、适用条件和因果关系都已核实;unsupported_claim 也不等于整篇论文不支持该论断。
原文高亮适用于可提取文字的 PDF,预览接口支持最大 50 MB 的文件。定位失败或暂时繁忙时,不生成未经确认的高亮,用户仍可打开来源阅读。
三、改写中的引用保留
用户要求缩写、调整结构或给原文加引号时,原有引用应随正文保留。为此,Lito 在准备历史消息时同时带入回答和来源映射。
系统会检查历史回答保存的引用。文件仍可访问、仍处于当前材料范围,来源才进入新一轮;不同轮次的引用先按真实来源关联,避免相同编号混淆;新回答再按实际引用顺序整理编号。逐页来源的身份包含页码,因此同一论文的不同页面可以保留区别。用户明确提到的编号则按最近一次回答解释。
通过检查的来源在模型生成前进入本轮引用映射,并与新回答一起保存。纯改写可以复用已有来源,刷新页面或重新打开会话后仍能查看引用。
引用关联帮助用户回查原文,模型辅助选择依据,原文高亮便于进一步阅读。观点是否得到充分支持,还需要结合研究条件和上下文判断。
历史引用恢复目前覆盖本地上传 PDF;已移除、不可访问或超出当前材料范围的来源,不会被恢复进新回答。
四、综述内部核验
综述核验由 Skill 在生成与修订之间执行。模型对照正文和提供的原文片段,检查研究发现、适用条件及文献之间的关系;代码校验返回格式、所选片段索引、原文锚点和引用映射。正文中的语义判断由模型完成,代码校验不能单独证明论断正确。
这项检查与用户查看引用时的原文定位分别触发。内部检查使用本轮提供的证据,不等于逐篇通读全文;用户回查则用于找到某处引用对应的原文。
缺少作者身份页不意味着结论没有证据;查到一个真实原文位置也不意味着它足以支持所写主张。共同引用可以分工支持一句中的不同内容,不能要求每篇独立证明全部子项。工作记录和此前检查结果不是原文。
修订保留完整稿件与引用。技术故障、待补证据和已确认的错述分别处理:故障不能把已有正文替换成只有说明的回答,已确认的错述仍须修正。交付说明只指出影响当前论述的具体限制,避免笼统要求重新核查全部文献。未复述所有方法参数不自动构成引文不支持,应判断省略是否改变当前主张的含义。