打开 Lito
Lito文档
打开 Lito

Observability 与 Evaluation

一篇综述漏掉关键论文,可能因为查询没有覆盖它、检索排位太低、证据在上下文取舍中被移除,也可能是模型看到后没有采用。最终回答只能呈现问题,过程记录帮助我们找到问题发生的位置;评测再判断修改是否改善了研究结果。

一、运行记录与问题定位

Lito 用 Run 关联一次执行,并在记录中保存 Trace、Span、消息和工具调用标识。原文另外保存为证据账本:同一片段有稳定的 evidence_id 和内容哈希,可以沿检索阶段追踪,也能识别实际引用的材料。

需要回答的问题 当前保留的依据
当时用什么条件跑的? 问题、模型、请求参数、提示词 hash、检索配置、语料签名和代码版本
相关论文在哪一步消失? 查询、关键词与向量候选、融合排序、数量限制、相关性选择和上下文扩展
模型实际收到了什么? 模型输入及提供商请求记录,关联当轮 Trace / Span
哪段原文被引用? 文献与片段标识、原文快照、阶段标记和最终引用关联
综述在哪次检查或修订中发生变化? Skill 加载标识、工作证据、补查计划、各版稿件和核验结果
为什么停止,消耗多少? 结束原因、调用次数、实际返回的 token、费用与记录完整性状态

例如,某篇论文的反例没有进入比较,可以将预期原文片段标为 bad case。系统在各阶段记录中做字面匹配,帮助定位它是否曾被召回、是否进入模型输入。含义相同但措辞不同的片段仍需要阅读判断,因此这项检查适合缩小排查范围。

context_seen=true 表示系统在回答请求中匹配到完整的原文快照。当前检查只标记长度至少为 30 个字符的完整匹配,因此 false 也可能表示内容较短或只带入了部分原文。研究进展记录的问题、论文与证据清单同样用于还原过程,逐个观点是否得到充分支持仍由评审判断。

二、本地记录与 Langfuse

本地记录保存深入排查需要的明细;Langfuse 提供模型调用追踪、分数展示和后续实验对比界面。当前二者接收数据的路径不同。

图 11-01点击放大

Langfuse 处理器把框架里的模型、工具、Agent 等 Span 转为云端记录,包含已埋点的输入输出、用量、错误与父子调用关系。RunControl.event() 则直接写入本地数据库;细粒度检索事件、完整证据账本和 Checkpoint 目前没有全量自动同步到云端。

开启运行记录后,每次运行的事件记录累计预算为 64 MiB。后续事件超出预算时不再写入,并以 trace_complete=false 标记记录不完整;已保存的检查点与证据保留。这个额度是事件记录限制,不代表全部运行数据的存储上限。隐身会话不进入本地运行记录流程,并抑制内容追踪。

用量按提供商实际返回的数据记录。未返回完整 token 用量,或缺少可用价格时,相关用量或费用标为未知,不能按零消耗统计。trace_complete=false 表示排查材料可能缺失,不直接判定回答不合格;回答与独立原文足以支持判断时,仍可评价内容。

综述工作记录保留证据整理、检查意见及修订过程,用于比较稿件变化。检查器的意见也可能被后续复核撤销,因此应同时查看最终稿、当前意见和原文,不能把某次检查结果直接当作评测分数。

运行记录供问题排查和评测使用。产品页面展示任务状态、回答和来源,追踪连接由管理端配置。

三、评测执行与归档

评测使用固定文献及其子集,分别检查检索工具、完整问答和连续修改。每个批次先明确题目、评分规则、资料范围、模型、配置和预算;独立案例使用新会话,多轮案例按约定顺序继续,各轮保留输入、结果和运行标识。题目总数、实际执行数和受阻项以该批次记录为准。

环节 保存的材料 用来检查什么
准备批次 题集、评分规则、论文范围、模型与代码记录 这次运行与上一版是否采用相同任务
执行案例 实际回答、工具结果、完成或失败状态 产品真正交付了什么
导出评审包 原问题、回答、PDF与压缩运行证据 让裁判按原文和逐题规则评分
独立评分 每轮档位、扣分规则、原句与证据 哪些问题影响了任务完成
复核争议 原分、调整后分数和调整理由 评分是否遗漏关键条件或放宽要求
版本对照 分数分布、同题表现和具体改动 改进是否落在原来的失败案例上

实际批次由脚本执行和导出评审包,评分结果以Markdown和JSON归档。Langfuse用于查看已接入的调用追踪与评分;题目、PDF、真实回答和版本对照在本地研究目录保留完整记录。

四、问题复测与版本对比

发现论文遗漏时,先确认原文是否进入本题允许的材料,再沿检索候选、筛选结果、工具正文、模型输入和最终回答排查。论文进入候选不代表模型已经读到;进入模型输入,也不代表最终回答正确采用了它。涉及综述修订时,继续比较检查前后的稿件,确认内容是否在修改中丢失。

先针对已确认的问题做定向复测,再按批次约定执行独立重复和全量对比。首次执行、重复验证和失败重试分别记录,不能只挑选最好的一次。定向验证通过只说明对应问题得到改善,不能替代同范围的版本评测。

五、结果判读

案例级任务达成率、回答整体档位、适用维度分数和工具表现分别统计,不合成一个总分。多轮案例按约定结束点判断任务是否达成,同时保留中途错误和用户纠错过程。执行覆盖率只说明跑了多少题,不等于任务达成率。

版本对比使用相同题目、标准和执行范围,并列报告任务达成率、同题改善与退步、关键错误和未交付情况,同时说明耗时与资源消耗。总体分数提高不能抵消新增的关键错误;具体通过要求在执行前确定,不因运行结果而临时放宽。

评分口径见评测体系设计,题目与参考依据见完整评测集。各批次分数、受阻项和版本对照统一保存在评测结果与版本记录。

图表