跳转到内容

成绩与局限

本页的数字都是我们自己跑的,来自发布版 G18b(2026 年 10 月)。以 brain/docs/results.zh-CN.md 为准;逐个任务的表格见 bench/results/reference.md。

条件:Bench v25,13 个在真实访达、文本编辑和 Safari 上运行的沙箱任务,每个跑 3 次,严格判定通过。通过 DeskMind Mac App 运行,在一台 48 GB 内存的 M4 Pro 上。

配置 严格通过 没做完就说完成 每次决策耗时(中位数 / 最慢 5%)
路由 G18b(0.8B → 4B,8 位,门槛 0.96),当前 39/39 0 2.85 / 9.82 秒
路由 G14(0.8B → 4B,8 位,门槛 0.94),上一版 36/39 0 0.57 / 5.25 秒
  • 严格通过:每个检查点都通过,没有违反任何约束,没有出现禁止的副作用,哨兵文件也没被动过。评分程序检查的是最终状态,不看 agent 自己怎么说。
  • 没做完就说完成:agent 宣布任务完成、评分程序却不认可的次数。
  • G18b 这次运行的条件: 没有环境故障,没有原地打转。App 里可选的检查都关闭,包括完成前的检查;新模型才会看到的「操作效果」附注也关闭。决策耗时基于 208 次决策。
  • 有一个任务不够干净。 中文精确文本任务的 3 次运行里,文件都写对了,但模型始终没有宣布完成,每次都用满 20 步。评分程序检查最终状态,所以这 3 次记为通过。

决策耗时指决策模型每一步用的时间,不是完成整个任务的时间。

步骤 占比 中位数 最慢 5%
由 0.8B 直接回答 约 30% 0.48 秒 0.66 秒
交给 4B 复核 约 70% 3.6 秒 9.8 秒
全部步骤 2.85 秒 9.82 秒

为什么大部分步骤会升级:G18b 的 0.8B 把握集中在约 0.94 到 0.97 这一窄段,要保证正确,门槛只能让大部分步骤交给 4B。把快速路径的比例拿回来,是下一轮的工作。

在 M4 Pro 上,时间花在哪:

  • 读提示(prefill)受算力限制,4B 每秒约 850 个 token。桌面的一步约 1,900 个提示 token,所以耗时取决于提示长度,与权重大小无关。
  • 量化对速度没有帮助:8 位速度不变,120 个答案中 119 个与原版相同;4 位没有变快,还有 30% 的答案变了。

JevBench v1.4.2 公开仓库里的 231 道题(即榜单的 public_accuracy 一列),用官方命令行工具在本机针对本地服务运行。JevBench 是第三方评测;DeskMind 与其维护方没有关联。

easy(48) original(72) hard(111) 公开题(231)
Brain 4B,G18b(当前) 48 69 76 0.835
Brain 0.8B,G18b 48 56 63 0.723
路由 G18b(0.8B → 4B,门槛 0.96) 48 65 71 0.797
Brain 4B,G14(上一版) 48 67 85 0.866
  • 以上只是公开题。 榜单主分还计入密封题、校准、速度和成本。我们还没有密封题的成绩。
  • G18b 的通用判断不如 G14。 4B 在 hard 档上从 85 降到 76,主要是时间和数字计算、复杂判断、多步推理这几类。G18b 的训练数据更偏向桌面状态。发布仍选 G18b,是因为它在真实桌面上更可靠。
  • 校准(G18b 4B): Brier 0.269,ECE 0.089(G14 为 0.230、0.079),两项都是越低越好。见概率意味着什么。
  • 没有重合: G18b 的训练数据(100,703 条)和这 231 道公开题没有任何相同的 13 词片段,也没有相同的选项集合。

ScreenSpot-Pro 全集(1,581 题),单次推理,在 GPU 上:Eyes-4B 67.7%,基座模型为 64.8%。App 里运行的是 4 位 MLX 版本,图片最大 200 万像素,这不是测评时的设置,目前还没有这个设置下的分数。详见 eyes/README。

来自上面的测量:

  • 速度。 约 70% 的步骤交给 4B,一次决策通常要 3 秒左右,最慢的 5% 接近 10 秒。
  • 适时宣布完成。 有一个 bench 任务已经做完,模型却一直没有宣布完成。
  • 通用判断。 G18b 在真实桌面上进步了,但在公开题的 hard 档上退步了。
  • 覆盖面。 13 个任务,一台 Mac,一种系统语言。只有访达和文本编辑有投影层;其他应用(包括 Safari)里,模型看到的是原始的辅助功能树。

来自 bench 之外我们自己的试用(还没有在公开的任务集上测过):

  • 长表格、带筛选的表格抄写。 抄写超过大约四行的表格,或只抄符合条件的行,目前还不可靠。有一次试用中,模型抄完六行里的三行就宣布完成了。
  • 照着拍下的收据填表。 用文字识别从收据照片里读出的值可能有错,照着这些值填表目前还不可靠。

每个数字对应的任务集、评分程序和执行框架版本,都在 deskmind-ai/bench 里:deskmind-bench score 从磁盘重新给结束的运行打分,deskmind-bench run 可以针对任何实现了 /v1/systemone 的决策服务跑这套任务。和我们结果不一致的复现,同样欢迎,见参与贡献。