项目已开源:https://github.com/cedsj/cetbenchCeworld TokenSaver Benchmark 是一套用于评估 AI Agent 框架在典型任务中 Token 消耗效率 的相对评分系统。 用户为每个 Agent 输入四项任务(T1~T4)的 Token 消耗量, 系统自动计算综合评分并给出等级评定。
核心思想: 在相同任务下,Token 消耗越少的 Agent 得分越高, 从而激励开发者优化 Agent 的输出精简度。
系统共包含四项测评指标,每项指标具有不同的权重和满分值:
| 指标 | 名称 | 权重 | 满分 | 说明 |
|---|---|---|---|---|
| T1 | 打招呼 & 自我介绍 | 20% | 200 | Agent 与用户初次交互时的问候与身份说明 |
| T2 | 数学推理 | 20% | 200 | Agent 处理数学问题时的推理能力 |
| T3 | 完整项目构建 | 30% | 300 | Agent 从零开始构建一个完整项目 |
| T4 | 了解项目结构 | 30% | 300 | Agent 理解并分析已有项目结构 |
对于每项指标,所有参与测评的 Agent 中 Token 消耗最少者 获得该指标的 满分,其余 Agent 按比例折算得分:
各项指标满分值如下:
假设有三个 Agent 在 T3(满分 300 分)中的 Token 消耗分别为 400、500、800:
| Agent | Token 消耗 | 计算过程 | T3 得分 |
|---|---|---|---|
| Agent A 最少 | 400 | 300 × 400400 | 300.00 |
| Agent B | 500 | 300 × 400500 | 240.00 |
| Agent C | 800 | 300 × 400800 | 150.00 |
总分 = T1 得分 + T2 得分 + T3 得分 + T4 得分
系统根据总分自动评定等级:
| 等级 | 总分范围 | 称号 | 含义 |
|---|---|---|---|
| A | ≥ 800 分 | Token节省者 🎉 | Token 利用效率极高,表现出色 |
| B | 600 ~ 799 分 | B | Token 利用良好,仍有优化空间 |
| C | 400 ~ 599 分 | C | Token 利用一般,需要改进 |
| D | < 400 分 | Token终结者 ☠️ | Token 消耗过高,效率亟待提升 |