打开 Lito
Lito文档
打开 Lito

评测结果

V1.0与V1.1使用相同的60题评测集,每版已执行56题,包括46个对话案例和10个检索工具案例。以下展示任务完成情况、回答质量、运行耗时及用户体验数据。

一、评测范围

1.1 60题执行总览

V1.0与V1.1的执行范围相同:

题目类型 题目总数 每版已执行 每版受阻
对话任务 50 46 4
直接工具题 10 10 0
合计 60 56 4

执行覆盖率为56/60(93.3%),表示完成执行的题目占比。4道对话题因测试条件不足受阻,待条件补齐后执行。

46个已执行对话案例产生61轮回答。下文的52.2%与76.1%分别表示两版在这46个案例上的任务达成率;10道工具题按检索维度单独展示。

完整题集共75轮输入,另列38项功能检查;这38项检查在本批未执行。

两版结果按统一评分标准复核,原始评分与调整记录分别保留。评分依据题目要求、实际回答与论文原文,具体方法见评测体系设计。

二、效果

2.1 对话案例完成情况(46题)

案例结果 V1.0 V1.1
确定达成 24/46(52.2%) 35/46(76.1%)
部分达成 17 9
未达成 5 2
待判断 0 0

同一案例比较,15例改善、27例持平、4例退步。46个案例覆盖单篇理解、多篇比较、综述、修改和原文核验。每例按题目要求判断完成情况;多轮题结合各轮要求与最终回答评价。

2.2 回答整体档位

档位 V1.0 V1.1
4分 26 31
3分 9 16
2分 21 12
1分 2 0
0分 3 2
3–4分合计 35/61(57.4%) 47/61(77.0%)
0–1分合计 5/61(8.2%) 2/61(3.3%)

逐轮比较有20轮升档、29轮同档、12轮降档。回答档位描述单轮质量;案例结果描述整道题是否完成,两种结果分别统计。

2.3 检索与工具

直接工具检查 V1.0 V1.1
R2:范围与候选召回 10题均U:缺少独立候选阶段日志 10题均U:缺少独立候选阶段日志
R3:选择与上下文 9题3分、1题2分 7题4分、3题2分
R3至少3分 9/10 7/10
R4:来源与传递 10题4分 10题4分

V1.0返回较完整的论文内容,同时带入较多无关正文、参考文献或附录,这9题的证据筛选得分为3分。V1.1修复了工具第5题遗漏P32的问题,但第6、8、10题分别遗漏认证数据机制、意外消息条件和替代关系较弱的实证发现。

直接工具题固定查询和材料,检查工具实际返回;完整对话还检查模型如何组织查询、补查和利用证据。对话中有相应过程记录时,同样评价R维度。10道直接工具题单独统计,用来定位工具问题;案例达成率统计46个对话案例。

2.4 关键错误与未交付

曾发生的问题(按对话案例分别去重) V1.0 V1.1
B0:可信度或隔离底线问题 0 1
B1:核心任务阻断 5 1

V1.1用户第22题虽然补齐15篇覆盖,首轮仍将反馈奖励解释成“购买好评”,续问没有澄清,因此案例最终未达成。专家第25题没有交付所要求的正文。这两例分别暴露了机制误述未纠正和正文未交付的问题。

查看15篇论文覆盖案例 · 查看V1.1问题与改进思路

三、性能

以下统计两版各61轮已归档对话运行,不包含10道直接工具题,也不加入开发期重试或新版本结果。

3.1 耗时与运行状态

指标 V1.0 V1.1 统计说明
服务端运行耗时中位数 27.69秒 20.96秒 各61轮,包含所有实际结束状态
服务端运行耗时P95 93.42秒 68.33秒 升序排列后取第58个值,表示约95%的运行耗时不超过该值
正常结束比例 59/61(96.7%) 60/61(98.4%) 运行状态为completed,不代表内容达到任务要求
时间预算耗尽 1/61(1.6%) 0/61 运行因时间预算结束,不等同于所有类型的超时
Token预算耗尽 1/61(1.6%) 0/61 达到运行Token预算而停止
执行失败 0/61 1/61(1.6%) 运行状态为failed,单列而不从耗时统计中排除

3.2 调用与Token用量

指标 V1.0 V1.1 统计说明
每轮模型调用中位数 15次 17次 各61轮,按运行汇总的llm_calls字段统计
每轮模型调用P95 24次 33次 包含研究链路内部调用,不只是最终正文生成
模型调用合计 900次 1,012次 各61轮,包括非正常结束的运行
每轮工具调用中位数 1次 2次 各61轮,按tool_calls字段统计
工具调用合计 53次 122次 一次工具调用可包含多个查询或内部步骤
每轮输入Token中位数 56,114 35,108 仅用量完整的59轮/60轮
每轮输出Token中位数 4,325 2,261.5 偶数样本取中间两项平均,不表示单次返回半个Token
已记录输入Token合计 4,084,738 3,089,289 仅用量完整的59轮/60轮,不是全部61轮的总消耗
已记录输出Token合计 572,446 191,492 同上;统计运行用量,不是最终正文的Token数

两版的索引、配置与运行条件存在差异,因此不能把变化全部归因于某一项改动。V1.1耗时更短,但模型与工具调用更多;调用次数、用量和回答质量需要分别判断。

3.3 数据完整性与统计边界

记录情况 V1.0 V1.1 处理方式
完整过程记录 60/61 60/61 耗时、状态和调用使用各轮汇总;过程日志缺失不直接删除整轮
完整用量记录 59/61 60/61 Token统计仅纳入usage_complete为true的轮次
费用记录 13轮估算、48轮未知 12轮估算、49轮未知 不把未知费用记为零,不据此计算全量实际费用

P95统一采用最近秩法,取排序后第ceil(0.95×样本数)项。正常结束比例是运行状态指标,与前面的案例级任务达成率分别统计。缺失与不完整记录保留,不能将其视为零消耗。

服务端运行耗时不等同于客户端首字时间或完整正文等待时间。客户端计时、完整重试与恢复统计、并发容量和实际费用尚缺少本批可比数据,暂不填写结果。

以上结果由冻结运行记录重新汇总,没有重跑用例或改变评分;逐轮来源、文件哈希及统计口径另存于历史性能汇总记录。

四、用户体验与功能检查

表达质量按E8评价回答的结构、清晰程度和阅读负担。实际采用情况、内容修改量和核验时间,将通过真实试用采集;本批尚无这部分数据。已有访谈用于设计写作与修改任务。

38项功能检查未在本批执行。文档解析、切块、索引更新、容量与恢复等专项继续按各自测试方案补充,结果注明材料和执行条件。

五、后续版本比较

V1.2正在开发面向研究论文综述章节的工作流,重点处理机制误述、必要条件遗漏、正文未交付和修改后错误保留。最新写作标准和示例已完成加载检查,实际写作质量仍待验证。后续结合新材料与原题回归检查章节组织、任务完成情况和具体退步,并补充耗时、用量和真实试用反馈。

评测体系设计 · 评测集构建 · 版本记录

图表