评测结果
V1.0与V1.1使用相同的60题评测集,每版已执行56题,包括46个对话案例和10个检索工具案例。以下展示任务完成情况、回答质量、运行耗时及用户体验数据。
一、评测范围
1.1 60题执行总览
V1.0与V1.1的执行范围相同:
| 题目类型 | 题目总数 | 每版已执行 | 每版受阻 |
|---|---|---|---|
| 对话任务 | 50 | 46 | 4 |
| 直接工具题 | 10 | 10 | 0 |
| 合计 | 60 | 56 | 4 |
执行覆盖率为56/60(93.3%),表示完成执行的题目占比。4道对话题因测试条件不足受阻,待条件补齐后执行。
46个已执行对话案例产生61轮回答。下文的52.2%与76.1%分别表示两版在这46个案例上的任务达成率;10道工具题按检索维度单独展示。
完整题集共75轮输入,另列38项功能检查;这38项检查在本批未执行。
两版结果按统一评分标准复核,原始评分与调整记录分别保留。评分依据题目要求、实际回答与论文原文,具体方法见评测体系设计。
二、效果
2.1 对话案例完成情况(46题)
| 案例结果 | V1.0 | V1.1 |
|---|---|---|
| 确定达成 | 24/46(52.2%) | 35/46(76.1%) |
| 部分达成 | 17 | 9 |
| 未达成 | 5 | 2 |
| 待判断 | 0 | 0 |
同一案例比较,15例改善、27例持平、4例退步。46个案例覆盖单篇理解、多篇比较、综述、修改和原文核验。每例按题目要求判断完成情况;多轮题结合各轮要求与最终回答评价。
2.2 回答整体档位
| 档位 | V1.0 | V1.1 |
|---|---|---|
| 4分 | 26 | 31 |
| 3分 | 9 | 16 |
| 2分 | 21 | 12 |
| 1分 | 2 | 0 |
| 0分 | 3 | 2 |
| 3–4分合计 | 35/61(57.4%) | 47/61(77.0%) |
| 0–1分合计 | 5/61(8.2%) | 2/61(3.3%) |
逐轮比较有20轮升档、29轮同档、12轮降档。回答档位描述单轮质量;案例结果描述整道题是否完成,两种结果分别统计。
2.3 检索与工具
| 直接工具检查 | V1.0 | V1.1 |
|---|---|---|
| R2:范围与候选召回 | 10题均U:缺少独立候选阶段日志 | 10题均U:缺少独立候选阶段日志 |
| R3:选择与上下文 | 9题3分、1题2分 | 7题4分、3题2分 |
| R3至少3分 | 9/10 | 7/10 |
| R4:来源与传递 | 10题4分 | 10题4分 |
V1.0返回较完整的论文内容,同时带入较多无关正文、参考文献或附录,这9题的证据筛选得分为3分。V1.1修复了工具第5题遗漏P32的问题,但第6、8、10题分别遗漏认证数据机制、意外消息条件和替代关系较弱的实证发现。
直接工具题固定查询和材料,检查工具实际返回;完整对话还检查模型如何组织查询、补查和利用证据。对话中有相应过程记录时,同样评价R维度。10道直接工具题单独统计,用来定位工具问题;案例达成率统计46个对话案例。
2.4 关键错误与未交付
| 曾发生的问题(按对话案例分别去重) | V1.0 | V1.1 |
|---|---|---|
| B0:可信度或隔离底线问题 | 0 | 1 |
| B1:核心任务阻断 | 5 | 1 |
V1.1用户第22题虽然补齐15篇覆盖,首轮仍将反馈奖励解释成“购买好评”,续问没有澄清,因此案例最终未达成。专家第25题没有交付所要求的正文。这两例分别暴露了机制误述未纠正和正文未交付的问题。
三、性能
以下统计两版各61轮已归档对话运行,不包含10道直接工具题,也不加入开发期重试或新版本结果。
3.1 耗时与运行状态
| 指标 | V1.0 | V1.1 | 统计说明 |
|---|---|---|---|
| 服务端运行耗时中位数 | 27.69秒 | 20.96秒 | 各61轮,包含所有实际结束状态 |
| 服务端运行耗时P95 | 93.42秒 | 68.33秒 | 升序排列后取第58个值,表示约95%的运行耗时不超过该值 |
| 正常结束比例 | 59/61(96.7%) | 60/61(98.4%) | 运行状态为completed,不代表内容达到任务要求 |
| 时间预算耗尽 | 1/61(1.6%) | 0/61 | 运行因时间预算结束,不等同于所有类型的超时 |
| Token预算耗尽 | 1/61(1.6%) | 0/61 | 达到运行Token预算而停止 |
| 执行失败 | 0/61 | 1/61(1.6%) | 运行状态为failed,单列而不从耗时统计中排除 |
3.2 调用与Token用量
| 指标 | V1.0 | V1.1 | 统计说明 |
|---|---|---|---|
| 每轮模型调用中位数 | 15次 | 17次 | 各61轮,按运行汇总的llm_calls字段统计 |
| 每轮模型调用P95 | 24次 | 33次 | 包含研究链路内部调用,不只是最终正文生成 |
| 模型调用合计 | 900次 | 1,012次 | 各61轮,包括非正常结束的运行 |
| 每轮工具调用中位数 | 1次 | 2次 | 各61轮,按tool_calls字段统计 |
| 工具调用合计 | 53次 | 122次 | 一次工具调用可包含多个查询或内部步骤 |
| 每轮输入Token中位数 | 56,114 | 35,108 | 仅用量完整的59轮/60轮 |
| 每轮输出Token中位数 | 4,325 | 2,261.5 | 偶数样本取中间两项平均,不表示单次返回半个Token |
| 已记录输入Token合计 | 4,084,738 | 3,089,289 | 仅用量完整的59轮/60轮,不是全部61轮的总消耗 |
| 已记录输出Token合计 | 572,446 | 191,492 | 同上;统计运行用量,不是最终正文的Token数 |
两版的索引、配置与运行条件存在差异,因此不能把变化全部归因于某一项改动。V1.1耗时更短,但模型与工具调用更多;调用次数、用量和回答质量需要分别判断。
3.3 数据完整性与统计边界
| 记录情况 | V1.0 | V1.1 | 处理方式 |
|---|---|---|---|
| 完整过程记录 | 60/61 | 60/61 | 耗时、状态和调用使用各轮汇总;过程日志缺失不直接删除整轮 |
| 完整用量记录 | 59/61 | 60/61 | Token统计仅纳入usage_complete为true的轮次 |
| 费用记录 | 13轮估算、48轮未知 | 12轮估算、49轮未知 | 不把未知费用记为零,不据此计算全量实际费用 |
P95统一采用最近秩法,取排序后第ceil(0.95×样本数)项。正常结束比例是运行状态指标,与前面的案例级任务达成率分别统计。缺失与不完整记录保留,不能将其视为零消耗。
服务端运行耗时不等同于客户端首字时间或完整正文等待时间。客户端计时、完整重试与恢复统计、并发容量和实际费用尚缺少本批可比数据,暂不填写结果。
以上结果由冻结运行记录重新汇总,没有重跑用例或改变评分;逐轮来源、文件哈希及统计口径另存于历史性能汇总记录。
四、用户体验与功能检查
表达质量按E8评价回答的结构、清晰程度和阅读负担。实际采用情况、内容修改量和核验时间,将通过真实试用采集;本批尚无这部分数据。已有访谈用于设计写作与修改任务。
38项功能检查未在本批执行。文档解析、切块、索引更新、容量与恢复等专项继续按各自测试方案补充,结果注明材料和执行条件。
五、后续版本比较
V1.2正在开发面向研究论文综述章节的工作流,重点处理机制误述、必要条件遗漏、正文未交付和修改后错误保留。最新写作标准和示例已完成加载检查,实际写作质量仍待验证。后续结合新材料与原题回归检查章节组织、任务完成情况和具体退步,并补充耗时、用量和真实试用反馈。