Ceworld TokenSaver Benchmark — 工作原理

1. 系统概述

项目已开源:https://github.com/cedsj/cetbenchCeworld TokenSaver Benchmark 是一套用于评估 AI Agent 框架在典型任务中 Token 消耗效率 的相对评分系统。 用户为每个 Agent 输入四项任务(T1~T4)的 Token 消耗量, 系统自动计算综合评分并给出等级评定。

核心思想: 在相同任务下,Token 消耗越少的 Agent 得分越高, 从而激励开发者优化 Agent 的输出精简度。

2. 测评指标

系统共包含四项测评指标,每项指标具有不同的权重和满分值:

指标 名称 权重 满分 说明
T1 打招呼 & 自我介绍 20% 200 Agent 与用户初次交互时的问候与身份说明
T2 数学推理 20% 200 Agent 处理数学问题时的推理能力
T3 完整项目构建 30% 300 Agent 从零开始构建一个完整项目
T4 了解项目结构 30% 300 Agent 理解并分析已有项目结构

3. 核心算法

3.1 评分公式

对于每项指标,所有参与测评的 Agent 中 Token 消耗最少者 获得该指标的 满分,其余 Agent 按比例折算得分:

某指标得分 = 该指标满分 × 该指标最小 Token 消耗量 该 Agent 的 Token 消耗量

各项指标满分值如下:

核心逻辑: 采用相对评价而非绝对评价。 得分高低取决于同批次 Agent 之间的横向对比,而非预设的阈值。

3.2 算法流程

  1. 输入各 Agent 在 T1~T4 四项指标中的 Token 消耗量
  2. 对每项指标,找出所有 Agent 中的最小 Token 消耗值(minToken)
  3. 按公式计算每个 Agent 在该指标上的得分
  4. 汇总四项指标得分,得到总分(满分 1000 分)
  5. 根据总分评定等级(A / B / C / D)

4. 计算示例

假设有三个 Agent 在 T3(满分 300 分)中的 Token 消耗分别为 400、500、800:

Agent Token 消耗 计算过程 T3 得分
Agent A 最少 400 300 × 400400 300.00
Agent B 500 300 × 400500 240.00
Agent C 800 300 × 400800 150.00

总分 = T1 得分 + T2 得分 + T3 得分 + T4 得分

5. 等级评定

系统根据总分自动评定等级:

等级 总分范围 称号 含义
A ≥ 800 分 Token节省者 🎉 Token 利用效率极高,表现出色
B 600 ~ 799 分 B Token 利用良好,仍有优化空间
C 400 ~ 599 分 C Token 利用一般,需要改进
D < 400 分 Token终结者 ☠️ Token 消耗过高,效率亟待提升

6. 设计原则