评测方法论说明 + 当前跑批实时进度(每 2.5 秒自动刷新)
tools/import_real_prompts.py 从日志导入真实 prompt。| 维度(中文名) | 标识 | 测什么 | 打分方式 |
|---|---|---|---|
| 结构化输出/格式合规 | structured_output | JSON Schema 遵循度、必填字段完整度、跨模型交接格式一致性 | 确定性校验(jsonschema) |
| 工具/函数调用 | tool_calling | 工具名正确性、参数 schema 合规、多轮调用稳定性 | 确定性校验(参数校验) |
| 长上下文与记忆 | long_context | 长文档理解、跨轮事实召回、上下文不丢失 | 确定性校验(事实匹配) |
| 中文与领域能力 | chinese_domain | 工程规范、桥梁铁路术语、专业问答正确性 | LLM 裁判 |
| 代码生成 | codegen | 按规范写函数/修 bug,沙箱内跑单测 | 确定性校验(沙箱执行) |
| 指令遵循 | instruction_follow | 显式约束(条数/禁用词/字数/格式)逐条满足 | 确定性校验(约束检查) |
| 创意能力 | creativity | 设定新颖度、展开张力、不落俗套 | LLM 裁判 |
| 文笔 | prose | 流畅度、意象、节奏感、无 AI 腔 | LLM 裁判 |
| 百万字小说逻辑 | novel_logic | 设定圣经一致性、时间线、伏笔回收、不破坏前文 | LLM 裁判 |
| 延迟与成本 | latency_cost | TTFT、总耗时、单价×token 估算 | 指标采集(非 0-100) |
| 多模型协作/交接 | collaboration | A 产出→B 消费的格式兼容与往返成功率(成对测试) | 确定性校验(成对跑) |
综合排行 = Σ(维度分 × 权重) / Σ权重;权重可在 config/dimensions.yaml 调整。