评测分析

全面了解 OfficeBench 评测引擎的工作原理

评测体系

OFFICEBENCH 是一个面向办公场景的大模型评测基准。不同于通用评测,OFFICEBENCH 针对办公文档中大量存在 Ground Truth 的场景特点,采用 客观校验 + AI 主观评审 双轨评分机制。

客观校验
格式约束、数值比对、沙箱执行等自动验证
主观评审
多 Judge 模型加权评分,覆盖语义质量
分层聚合
用例 → 难度档 → 能力域 → 赛道 → 综合分

评测流水线

预检验证
结构校验与标定
对每条测试用例进行完整性校验,确认赛道归属、难度等级和能力域标注无误,并自动生成标准化的提示词模板,为后续评测做好准备。
模型推理
并发请求与响应采集
向被测模型并发发送评测请求,采集完整输出结果,同时记录首字延迟和总耗时等性能指标,支持文本、全模态、图生文、文生图四种模型类型的智能路由。
客观校验
自动化多维度验证
运用沙箱执行、定量指标、规则约束和工具调用四类校验器,从不同维度自动验证模型输出的正确性,确保评测结果客观可靠。
主观评审
多裁判交叉评分
由多个独立的裁判模型逐条审核每个检查点,采用二值判定、分级打分和底线检测三种评审模式。当某个裁判评分异常时自动剔除并重新计算权重,保证评分公正。
聚合输出
多层汇聚与报告生成
将单条用例的评分逐层汇聚——经过难度加权、能力域归集、赛道整合和语言权重调整——最终输出综合得分,并生成排行榜和详细评测报告。

赛道体系

赛道划分

横切维度

评分机制

CRITICAL 加权计分

Scase=Σ100 × wiW×scorei
Scase单用例最终得分
wi条件权重(CRITICAL=3, 普通=1)
W所有条件权重之和 Σw_i
scorei第 i 个条件的得分率 (0~1)
CRITICAL 条件权重为 {{weight}},普通条件权重为 1。单用例得分 = Σ(100 × w_i / W) × score_i,W 为所有条件权重之和。

规则评分

基于预定义规则自动校验,结果为通过或不通过:

通过→ peri
不通过→ 0

AI 评分

由多个裁判模型逐条评审,支持两种评分模式:

默认二值通过 → A,不通过 → 0
[GRADED] 分级按 score_pct 比例得分:score_pct/100 × A
[CRITICAL] 底线底线检查点不通过 → 封顶 60,每多一个再递减

客观校验方法

在客观校验阶段,由 4 种自动化 Checker 对模型输出进行多维度验证,每种 Checker 针对不同场景设计:

Sandbox Checker

在隔离沙箱中执行代码或公式,验证执行结果是否与预期一致(如计算值比对、程序输出校验、表格内容比对等)。

Metric Checker

计算量化指标(如 BLEU、ROUGE、F1、字符错误率等),将模型输出与标准答案进行自动化数值评估。

Constraint Checker

校验模型输出是否满足预定义的硬约束规则(如字数范围、关键词包含/排除、正则匹配、列表条目数等)。

Tool-call Checker

作为 Agent 赛道的客观校验,验证模型在多步任务中的工具调用轨迹,包括工具选择、参数准确性、调用顺序及次数限制。

分数聚合流程

难度分层

🟢L1 Basic

基础功能验证

🔴L2 Hard

复杂场景、长上下文、多约束叠加