媒体 Brief / Harness 工程 / Agent 基准

贵 57.1 倍的 Claude Opus 4.8 五项全输
赢它的不是模型,是 Harness

$0.175/M 的 DeepSeek V4 Flash 跑在 Floatboat 上:五项全胜,HLR 最高 3.57×

08.13 更新已补充 DeepSeek V4 Pro 正式版对照 →
Floatboat 本次官方实测五项第三方 Benchmark同模型单变量对照完整披露评测口径
PRICE GAP
57.1×
Opus 4.8 混合成本倍数
WIN / FIVE
5 / 5
五项基准全部超过 Opus 4.8
DEEPSWE HLR
3.6×
仅替换 Harness 的系统杠杆率
MIXED COST
$0.175
每百万 Token · 3:1 输入输出比

一个 $0.14/$0.28 的模型,在五项第三方基准上全部超过了 $5/$25 的 Claude Opus 4.8——两者混合成本相差 57.1 倍

但这不是一次便宜模型的胜利。同一个 DeepSeek-V4-Flash,跑在模型厂自己的系统上,DeepSWE 只有 54.4,低于 Opus 4.8 的 58.0。放到 Floatboat 上,它跑到了 67.25

模型没换,成本没换,换的是 Harness——模型之外的那半个系统。

而这件事之所以值得单独拿出来说,是因为它指向一个更基本的判断:多、快、好、省同时成立,AI Agent 工作台才能真正进入日常工作——而答案不只在模型那一侧。

Model + Harness = Agent。左半边每次模型发布都附一张榜单,右半边却长期没有一把尺子。

Floatboat 提出 HLR(Harness Leverage Ratio,Harness 杠杆率) 来量这半边。它可以直接理解为:换 Harness 的收益 ÷ 换模型的收益。HLR > 1,意味着不换模型、只换 Harness 获得的增量,已经超过从基线模型系统升级到参照模型系统的收益。

在 DeepSWE 上,这个比值是 3.6×:同一模型放到 Floatboat 上多拿到 12.85 分,而 DeepSeek 官方系统与 Opus 4.8 之间只有 3.6 分不换模型,只换 Harness,拿到了 3.6 倍于换到 Opus 4.8 的收益。(通俗定义与五项计算见第六节)

得一提的是,8月12日晚间,DeepSeek V4 Pro正式版也更新了。

Floatboat Harness 和 DeepSeek V4 Flash 的组合增益,相比DeepSeek V4 Pro 跟官方 Harness的组合,依然毫不逊色。在长程任务上,评分甚至比 DeepSeek V4 Pro 更优。

按任务程长对比 Floatboat Harness 配合 DeepSeek V4 Flash 与 DeepSeek V4 Pro 官方 Harness 相对 V4 Flash 官方 Harness 的增益。

本次 Floatboat x DeepSeek-V4-Flash 完整评测显示,Harness 杠杆呈现清晰分布:Terminal Bench 2.1 提升 1.9%,AutomationBench 提升 9.6%,Toolathlon 提升 12.6%,BrowseComp 提升 19.9%,DeepSWE 提升 23.6%。任务越长程,Harness 的杠杆越大。而真实工作恰好是长程的那一类。

一、本次发布的完整数据

五项第三方基准的实测成绩、按输入输出比折算的成本倍数、每一个对照分数的来源链与 Harness 配置,都在这一节。

1.1 单位成本效率:每 1 美元输出换回多少榜单分

成绩与价格进同一个式子:榜单真实跑分 ÷ 每百万 Token 输出价。缺失成绩不补零,也不参与该榜计算。图末六张卡片给出五项基准的逐榜名次与价格榜。

卡片最右一列的成本倍数按 8:1 输入输出比折算,(8 × 输入价 + 输出价) / 9,以 Floatboat 为 1.0×。全文标题与第二节的 57.1× 出自 3:1 折算,两套比例各自标注,不混算。

图表与卡片默认只列混合成本低于 Floatboat 20 倍的同价位档,成本 ≥20× 的四个高价模型收在按钮之后。

INTERACTIVE CHART 五项基准的单位成本效率,按榜单分列
核心图表 / FIVE-BENCH COST EFFICIENCY

每 1 美元输出,能换回多少真实榜单分?

真实跑分与公开单价同时纳入计算,缺失成绩不补零、不参与该榜比较。
统一计算口径榜单真实跑分 ÷ 每百万 Token 输出价
对比成绩:按当前榜单动态统计成本倍数:8:1 混合口径
当前结论
色阶 名次在前,灰色更深 名次在后,灰色渐浅 金色为 Floatboat

Floatboat 在对比集内的名次:Toolathlon 第 1/10、BrowseComp 第 3/11、AutomationBench 第 3/12、DeepSWE 第 4/12、Terminal Bench 2.1 第 6/12。以上为各榜完整名次,不受上方同价位档筛选影响。

口径

Floatboat 五项成绩由 Floatboat Evaluation Harness 本次实测。其余模型沿用对应 Benchmark 或厂商公开结果,各家的 Harness、推理配置与数据集版本不尽相同,横向名次因此只用于观察公开成绩区间;同模型的 Harness 对照控制到相同底座与相同输入参数。

成本倍数为 8:1 混合口径 (8 × 输入价 + 输出价) / 9;全文标题与第二节的 57.1× 为 3:1 混合口径 (3 × 输入价 + 输出价) / 4。两者都是按公开单价折算的估算值,不含缓存命中、长上下文阶梯价与工具调用费,不等于端到端任务成本。

1.2 各模型跑分来源链与 Harness 详表

12 个模型或运行环境在五项基准中的公开成绩、Harness 配置与比较口径,按 8:1 混合成本倍数分两组列出,分组与上方卡片的「成本倍数」列同源。

1.2.1 相对 Floatboat 低于 20×

8 个模型 / 环境,成本倍数 1.0×–18.6×。

模型/环境 BrowseComp (分数 / Harness / 来源) DeepSWE (分数 / Harness / 来源) Terminal Bench 2.1 (分数 / Harness / 来源) AutomationBench (分数 / Harness / 来源) Toolathlon (分数 / Harness / 来源) 口径说明
Floatboat / V4-Flash 87.80 [F]
Floatboat_Harness (自研)
67.25 [F]
Floatboat_Harness (自研)
84.26 [F]
Floatboat_Harness (自研)
27.50 [F]
Floatboat_Harness (自研)
79.62 [F]
Floatboat_Harness (自研)
Floatboat 本次发布:五项均由 Floatboat Evaluation Harness 实测。
DeepSeek V4-Flash 0731 映射争议:73.2 [D1]
未披露/模型标签错配
54.4 [D2] / 53±4 [DS]
DeepSeek_Harness_minimal
82.7 [D2]
DeepSeek_Harness_minimal
25.1 Public [D2]
DeepSeek_Harness_minimal
70.7±0.9 [TV] / 70.3 [D2]
DeepSeek_Harness_minimal(正式对照取 70.7)
A/X:厂商自报为主;Browse 存在标签争议;Toolathlon 官方复测与自报并存。
V4-Flash Preview 映射争议:53.5 [D1]
未披露/模型标签错配
7.3 [D2]
DeepSeek_Harness_minimal
61.8 [D2]
DeepSeek_Harness_minimal
10.8 Public [D2]
DeepSeek_Harness_minimal
49.7 [D2] / 50.9±1.5 [TV]
DeepSeek_Harness_minimal
A/X:版本和标签均需显式披露,Verified 新分数与旧版不可直比。
V4-Pro Preview 映射争议:80.4 [D1]
未披露/模型标签错配
12.8 [D2]
DeepSeek_Harness_minimal
72.1 [D2]
DeepSeek_Harness_minimal
12.8 Public [D2]
DeepSeek_Harness_minimal
55.9 [D2] / 55.9±1.2 [TV]
DeepSeek_Harness_minimal
A/X:自报与官网 Verified 均有列出,旧模型卡与新版存在变更冲突。
GPT-5.6 LUNA 83.3 [O]
OpenAI_agentic_browsing
67.2 [O] / 67±4 [DS]
mini-SWE-agent
84.7 [O] / 75.7±1.3 [TB]
Codex_CLI / Terminus-2
14.9 Private [O/AB]
Zapier 官方
A/X:轻量级底座,Harness 口径不同。
GLM-5.2 46.2 [D2/G] / 44±2 [DS]
mini-SWE-agent
81.0 [D2/G] / 82.7 [G]
Terminus-2 / Claude Code
12.9 Public [D2] / 14.0 Private [AB]
DeepSeek_Harness_minimal / Zapier 官方
59.9 [D2/K] / 59.9±1.9 [TV]
Toolathlon 官方
A/X:不同 Harness / 数据集口径并存。
Qwen3.8-Max 62.0 [F]
未披露且 Qwen 官网未找到
56.6 [Q] / 57±3 [DS]
mini-SWE-agent
86.6 [Q]
Qwen Harness
27.3 Public [Q]
Qwen Harness
72.5 [Q]
Qwen Harness
A/B/X:厂商自报对照;Toolathlon 尚无官网独立排行榜条目。
Claude Sonnet 5 84.7 [AS]
Anthropic_agentic_search
54±4 [DS]
mini-SWE-agent
80.4 [AS] / 74.6±1.6 [TB]
mini-SWE-agent / Claude Code
13.5 Private [AS] / 14.2 [AB]
Zapier 官方
71.6±1.2 [TV]
Toolathlon 官方
A/X:官网运行配置不同(带置信区间)。

1.2.2 相对 Floatboat 达到或超过 20×

4 个模型 / 环境,成本倍数 20.0×–92.9×。Terra 恰为 20.0×,按临界值归入本组。

模型/环境 BrowseComp (分数 / Harness / 来源) DeepSWE (分数 / Harness / 来源) Terminal Bench 2.1 (分数 / Harness / 来源) AutomationBench (分数 / Harness / 来源) Toolathlon (分数 / Harness / 来源) 口径说明
GPT-5.6 TERRA 87.5 [O]
OpenAI_agentic_browsing
69.6 [O] / 70±3 [DS]
mini-SWE-agent
87.4 [O] / 78.4±1.3 [TB]
Codex_CLI / Terminus-2
15.2 Private [O/AB]
Zapier 官方
A/X:Terminal Harness 不同导致分数显著差异。
Claude Opus 4.8 84.3 [AO/O]
Anthropic_agentic_search
58.0 [D2/G] / 59±2 [DS]
DeepSeek_Harness_minimal / mini-SWE-agent
82.7 [D2/G] / 78.9±1.3 [TB]
DeepSeek_Harness_minimal / Terminus-2
27.2 Public [D2/Q/K] / 15.5 Private [AO] / 17.2 [AB]
DeepSeek_Harness_minimal / Zapier 官方
76.2 [D2/Q/K] / 76.2±3.4 [TV]
Toolathlon 官方
A/X:多份厂商自报及多 Harness 并存。
GPT-5.6 SOL 90.4 [O]
OpenAI_agentic_browsing
72.7 [O] / 73±3 [DS]
mini-SWE-agent
88.8 [O] / 91.9 [O] (4-agent)
Codex_CLI
29.7 Public [Q/K] / 18.1 Private [O/AB]
AutomationBench 官方 / Zapier 官方
74.9 [Q/K]
Toolathlon 官方
A/X:SOL 为单 agent,Ultra 为 4-agent 混合,不可混同。
Claude Fable 5 88.0 [K]
Kimi_agentic_browsing
70.0 [Q/K] / 70±4 [DS]
mini-SWE-agent
84.3 [AF] / 83.8 [TB]
mini-SWE-agent / Claude Code
29.1 Public [Q/K] / 17.4 Private [O/AB]
AutomationBench 官方 / Zapier 官方
77.9 [Q/K]
Toolathlon 官方
A/X:包含 fallback 与多 Harness 警告。
公开资料索引
[F] Floatboat 本次发布
Floatboat Evaluation Harness 在五项 Benchmark 上的完整实测成绩。
[M] 机器之心报道
《贵 57.1 倍的 Claude Opus 4.8 五项全输,赢它的不是模型,是 Harness》↗本文叙述、程长分档与 HLR 参照选择规则按该报道口径更新;原始分数仍以各 Benchmark 与厂商来源为准。
[D1] DeepSeek V4-Flash/Pro 官方模型卡
HuggingFace 模型卡 ↗模型卡于 8 月 12 日晚间更新为正式版。链接未固定 commit,后续内容仍可能更新。
[D2] DeepSeek V4-Flash-0731 官方模型卡
HuggingFace-0731 模型卡 ↗列出官方 Harness 极简模式下(max 档位、top_p=0.95、temperature=1.0)多项对照分。属于自报一手数据(A)。
[DS] DeepSWE 官方榜
deepswe.datacurve.ai ↗Datacurve 官方统一使用 mini-swe-agent 复测成绩(带置信区间)。属于(A)。
[Q] Qwen3.8 官方发布页
Qwen3.8 Blog ↗列出 Qwen3.8-Max 自报 Pass@1 72.5% 等。属于自报对照数据(A/B/X)。
[G] GLM-5.2 官方发布页
智谱 Z.ai Blog ↗作为智谱厂商自报来源。属于(A)。
[AO] Claude Opus 4.8 官方发布页
Anthropic Opus 4.8 News ↗
[AS] Claude Sonnet 5 官方发布页
Anthropic Sonnet 5 News ↗
[AF] Anthropic Fable 5 技术资料 PDF
Anthropic Fable PDF ↗
[O] OpenAI GPT-5.6 发布及规格说明页
OpenAI GPT-5.6 Index ↗
[TB] Terminal-Bench 2.1 官方榜
Terminal-Bench Leaderboard ↗
[TV] Toolathlon-Verified 官方榜
Toolathlon Leaderboard ↗2026-06-30 起使用的 Verified 新分数序列。
[TL] Toolathlon 旧版官方榜
Toolathlon 官方榜底部的 Previous 历史数据,由于任务定义和基础设施不同,与 Verified 序列不具备可比性。
[AB] AutomationBench 官方榜
Zapier Benchmarks ↗Zapier 官方 1.0.5 私有 held-out 榜,与自研自报的 600 题公开研究集并非同数据集。

二、先看「好」:$0.175 打 $10,五项全部超越

「好」是硬门槛。一个 Agent 工作台如果交付不了真实任务,再便宜也不会有人每天打开它。

过去这道门槛只能用钱换。Floatboat 这份成绩单的意义在于,它把这个交换取消了。

基准 Floatboat (V4-Flash)
$0.175/M
Claude Opus 4.8
$10/M · 贵 57.1×
分差 相对
DeepSWE 67.25 58.0 +9.25 +15.9%
Toolathlon 79.62 76.2 +3.42 +4.5%
BrowseComp 87.80 84.3 +3.50 +4.2%
AutomationBench 27.50 27.2 +0.30 +1.1%
Terminal Bench 2.1 84.26 82.7 +1.56 +1.9%

五项全部超越 Claude Opus 4.8。即使在增益最小、程长最短的 Terminal Bench 2.1 上,Floatboat 也以 84.26 对 82.7 领先 1.56 分。

差距最大的是 DeepSWE——仓库级全栈代码开发,Floatboat 67.25 对 Opus 4.8 的 58.0,领先 15.9%。而两者的价格差是 57.1 倍。

这里的底座不是什么特调版本。DeepSeek V4 Flash 是官方 API 谁都能调的模型,$0.14 输入、$0.28 输出。按 Agent 场景典型的 3:1 输入输出比折算,混合价为 $0.175/M,只有 Opus 4.8 的 1/57。

顺带说「快」:不是推理速度,是这个价格带来的使用方式

先说清口径:本文五项基准都是任务完成质量,没有延迟或耗时数据,本文不对速度指标作数据声称。

「快」指的是另一件更实际的事——你从犹豫要不要用它,变成直接让它跑。混合价 $0.175/M 意味着一个长程任务的成本可以忽略;跑歪了重跑一次,代价同样可以忽略。而 Opus 4.8 是 $10/M,贵 57.1 倍,很多团队用它时要先掂量这一趟值不值。当成本低到不需要掂量,Agent 才会被真的用起来,而不是被珍惜着用。

第九节还有另一半:客户端把文件管理器、编辑器、浏览器原生集成在一个窗口里,省掉的是人这一侧反复上传、下载、切应用的往返。这两件事合起来,才是「快」在这份材料里的确切含义。

三、这是 Harness 对 Harness 的单变量实验

一份跨系统对比要能被采信,方法学比结论重要。所以在给出任何 Harness 差值之前,先把对照组的配置摆完整。

  • 双方统一使用 DeepSeek-V4-Flash 0731 模型底座
  • DeepSeek 官方公开基准中的 Code Agent 任务使用 DeepSeek Harness(即将发布)的极简模式,配置为 max 档位、top_p=0.95temperature=1.0
  • Floatboat 侧统一在 Floatboat Evaluation Harness 下执行;大部分基准的模型推理由 DeepSeek 官方 API 提供
  • 所有任务在完全隔离、开箱即用的物理沙盒环境中独立运行
  • 输入参数完全一致

这比「Floatboat 对裸模型 API」更严格,也更有价值:模型相同、模型厂自己的 Harness 也在场,唯一需要解释的变量就是两套 Harness 的系统工程差异。

因此,54.4、73.2、82.7、25.1、70.7 不是裸模型能力,而是 DeepSeek-V4-Flash + DeepSeek 官方 Harness 的系统成绩;67.25、87.80、84.26、27.50、79.62 则是同一模型接入 Floatboat Harness 后的系统成绩。两者的差值,就是 Floatboat Harness 相对模型厂官方 Harness 造出的增量。

对照组取的是 DeepSeek-V4-Flash-0731 + DeepSeek 官方 Harness 的正式成绩,不是更早的 Preview checkpoint。第一节的表里两行都在——用 Preview 的话,DeepSWE 一项就是 7.3 → 67.25,涨幅 821%,一个漂亮得多的数字,但它混进了模型自身后训练迭代与 Harness 对照变化,不能归给 Floatboat Harness。

四、任务越长程,Harness 增益越大

如果只看「五项都赢了」,这份成绩单还只是一次跑分。真正有信息量的是增益的分布。

同一个 DeepSeek V4 Flash(0731 checkpoint),分别由 DeepSeek 官方 Harness 与 Floatboat Harness 驱动:

基准 任务性质 DeepSeek 官方 Harness Floatboat Harness Harness 差值 相对提升
Terminal Bench 2.1 单环节命令行调试 · 短程 82.7 84.26 +1.56 +1.9%
AutomationBench 跨 SaaS 多应用流程 · 中程 25.1 27.50 +2.40 +9.6%
Toolathlon 复杂工具调用与长程交互 · 中长程 70.7 79.62 +8.92 +12.6%
BrowseComp 多跳检索证据整合 · 中长程 73.2 87.80 +14.60 +19.9%
DeepSWE 仓库级全栈开发 · 长程 54.4 67.25 +12.85 +23.6%

1.9% → 9.6% → 12.6% → 19.9% → 23.6%。

五项全部具备官方 Harness 对照。按任务程长从短到长排列,程长分档非递减、增益单调递增,没有例外项。任务链条越长、环节越多、越依赖跨步骤的状态维持和自我修正,Harness 的增益越大;任务越短、越单点、越接近一次性问答,增益越小。

BrowseComp 官方未披露平均步数,它的「中长程」依任务设计判断:多跳检索、搜索首屏无法直接回答、检索链长度事前不可知,且需跨源证据交叉验证。它与 Toolathlon 同属中长程档,同档内按增益排序,两者先后不代表程长差异。

Terminal Bench 2.1 是沙盒里的命令行调试,单环节、闭环短——这一项 Floatboat 只涨了 1.9%,但仍以 84.26 对 82.7 超过 Opus 4.8。短程任务里 Harness 杠杆较小;长程任务里的优势则显著放大。

反过来,Toolathlon 覆盖复杂的工具调用与长程交互决策。Floatboat 79.62,在本次对比集内数值最高,超过 Qwen3.8-Max(贵 14.9×)7.12 分,超过 Opus 4.8(贵 57.1×)3.42 分。由于不同公开结果采用的 Harness 与运行配置不完全相同,这里比较的是本次对比集中的公开数值,不将其表述为统一 Harness 下的官方统考排名。

真实工作恰好是长程的那一类。用户日常要处理的不是一条命令,是跨文件、跨应用、跨很多步、中途还要改主意的活儿。

五、这五道题都不是自己出的

上面所有数字的分量,取决于题目是谁出的。

基准 出品方 设计 程长
DeepSWE Datacurve 113 个完全未泄漏的真实代码库,平均修改 7 个文件、新增 668 行代码,配严密行为校验器
BrowseComp OpenAI 官方 需多跳检索、搜索引擎首屏无法直接回答的难题,考验反复修正查询与长文本证据交叉验证 中长
Toolathlon Toolathlon 团队 调用各类系统与本地工具解决复杂实际办公任务,考核多步骤工具决策与复杂状态维持 中长
AutomationBench Zapier / AA 模拟 47 个主流 SaaS、近 500 个 API 端点,沙盒中混有干扰与陈旧数据
Terminal Bench 2.1 Harbor Framework 沙盒终端里的环境配置、环境排错与复杂运维

「113 个完全未泄漏的代码库,平均改 7 个文件、新增 668 行」「47 个 SaaS、近 500 个 API 端点,还混着陈旧数据」——这类任务过不去提示词技巧那一关。它要求真实的文件存取、多步排错、跨应用状态维持,以及在错了之后自己发现并纠正。

这也解释了为什么增益集中在长程任务上:短程任务考模型的单次输出质量,长程任务考的是整个执行系统。

六、Harness 值多少分:一个可以重算的指标

行业开始共识 Model + Harness = Agent。左半边被反复计量,每次模型发布都附一张榜单。但右半边一直没有数字,连边界都很少被说清。

Floatboat 正在把前沿模型能力,转化为领先的 Agent 产品。这其中除模型本身以外的所有工作,都属于 Harness 的范畴。

这个范畴不小:模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里,全都在里面(第七节会逐层展开)。它长期缺的不是重要性,而是一把尺子。

Floatboat 提出了一个可以跨 Harness、跨模型重算的比值。最容易理解的写法是:

在同一项 Benchmark 上:

  • 换 Harness 的收益:保持底座模型不变,从基线 Harness 换到待测 Harness 后增加了多少分;
  • 换模型的收益:从同一个基线系统出发,换到参照模型系统后增加了多少分。

因此,HLR > 1,意味着不换模型、只换 Harness 获得的增量,已经超过换到参照模型系统的收益。

本指标默认使用「分数越高越好」的 Benchmark,要求分子与分母采用同一评价口径,并按 Benchmark 分别计算,不跨基准求平均。

本次实验保持 DeepSeek-V4-Flash 不变,以 DeepSeek 官方 Harness 为基线、Floatboat Harness 为待测 Harness。参照系统先按统一规则选择:主参照为 Claude Opus 4.8;若它在某一项不高于基线系统,则改取该项最便宜的有效参照,用一次真实、代价最小的模型升级来标定“换模型的收益”。

以 DeepSWE 为例:

  • DeepSeek-V4-Flash + DeepSeek 官方 Harness:54.4
  • Claude Opus 4.8 公布成绩:58.0,换模型的收益为 3.6 分
  • 同一 DeepSeek 模型放到 Floatboat 上:67.25,换 Harness 的收益为 12.85 分
  • HLRDeepSWE = 12.85 ÷ 3.6 = 3.57 ≈ 3.6×

五项完整结果:

基准 参照系统 换 Harness 的收益 换模型的收益 HLR
Terminal Bench 2.1 GPT-5.6 Luna +1.56 2.00 0.78×
AutomationBench Claude Opus 4.8 +2.40 2.10 1.14×
BrowseComp Claude Opus 4.8 +14.60 11.10 1.32×
Toolathlon Claude Opus 4.8 +8.92 5.50 1.62×
DeepSWE Claude Opus 4.8 +12.85 3.60 3.57×

0.78× → 1.14× → 1.32× → 1.62× → 3.57×。按程长从短到长排列,程长分档非递减、HLR 单调递增,没有例外项:越长程,Harness 的杠杆越高。

Terminal Bench 2.1 上,Opus 4.8 与 DeepSeek 官方 Harness 同为 82.7,没有发生模型跃迁,因此不能作为有效参照。按预先声明的规则改取最便宜的有效参照 GPT-5.6 Luna(84.7),得 1.56 ÷ 2.00 = 0.78×。这一项全部有效参照的 HLR 区间为 0.26×–1.42×,本文采用规则固定的唯一取值,不在候选中择优。

HLR 是 Floatboat 提出的新指标,不是行业标准,换参照系统后数值会变化。它的分子和分母都直接取自第一节的成绩表,参照选择规则也已公开,任何人都可以按“换 Harness 的收益 ÷ 换模型的收益”逐项重算。

七、12.85 分从哪来:一套持续逼近交付标准的系统

12.85 分不是任何单点技巧的产物。提示词工程、上下文压缩、工具重排这类手段的增益通常在 1–3 分量级。要解释一个量级更大的差值,得先回答一个更基本的问题:长程任务到底是怎么失败的?

答案不是「某一步答错了」。

长程任务的失败,通常是循环没有收敛——它与真正的交付标准越走越远。走远有两个成因:一是交付标准在任务开始时并没有被完整说出来;二是模型每一轮的微小偏差,会在下一轮把上一轮产物当作前提时持续累积。真实工作不是标准答案题:人的意图往往随着中间产物逐渐清晰,而模型带着逐轮变形的目标继续向前,二十步之后就可能形成方向性错误。

这就是「Proactive」在系统层面真正的含义,也是 Floatboat 的设计起点。

今天不少产品把定时唤醒、自动执行预设动作称为「Proactive Agent」。但那只是触发器的主动,不是 Agent 的主动。真正的 Proactive Agent OS,不在于系统能否在没人点击按钮时开始工作,而在于:当用户只说出了一个模糊目标,甚至自己也尚未完全知道什么才算好时,Agent 能否在长程任务中不断探索、执行、观察、修正与自我反思,主动识别结果与目标之间的差距。

好的 Harness 不能把第一句话当成一份永远不变的规格书。它必须在一次又一次 Loop 中持续逼近交付标准,必要时引导用户把未曾言明的要求清晰化,再把这些要求真正实现出来。

主动性的高级形态,不是替用户定时执行,而是帮助用户发现自己真正要什么,并把它做到。这才是 Agent OS 与自动化脚本、聊天机器人之间的分界线。

也正是这条分界线,解释了第四节那组数字为什么按程长排序:任务越长,未被说明的标准越多,「持续逼近」的价值就越大;任务短到只有一次问答,就没有可逼近的空间。 23.6% 与 1.9% 的差距,量的就是这件事。

这件事需要整个栈都在自己手里

「持续逼近交付标准」听上去像一句设计理念,但它落地需要四层能力同时成立。这也是 AOE Tech Labs 从第一天起就走了当时看起来最不划算的路的原因。

在行业普遍基于 Claude Agent SDK 套壳做应用、几周就能出一个 demo 的时候,他们选择自研整个软件的 Runtime、Agent Loop、Tools、Infra,以及 FloatSail(Evolution System)。这条路慢得多、重得多,在当时看不到回报。

而这四层各自决定了什么,恰好对应长程任务的四种死法:

Runtime 决定 Agent 能碰到什么。进程、文件系统、权限、沙盒边界——它划定了模型的手能伸多远。DeepSWE 要平均修改 7 个文件、新增 668 行代码,AutomationBench 要在 47 个 SaaS、近 500 个 API 端点之间穿行,这些任务的前提是真实的读写权和执行权,不是把文本递进去再取出来。

Agent Loop 决定长程任务能否收敛。它不是让模型机械地多跑几轮,而是让每一轮的探索都缩短当前结果与最终交付标准之间的距离:从执行中获得新信息,从观察中发现偏差,从失败中修正路径,从中间产物里反推出用户没有明说的要求;该回退时回退,该追问时追问。对模糊目标,它把标准逐轮问出来、试出来;对模型偏移,它重新对齐目标锚点,判断哪些信息必须原样保留、哪些可以压缩,并在偏差还只是偏差时把它按回去。前面说的那种「主动」,物理上就住在这一层。

Tools 决定模型能否正确消费结果。工具的粒度、返回结构、错误语义——一个把失败包装成空字符串的工具,会让模型在第 15 步做出一个自信的错误决策。这类问题在单轮问答里看不见,在 20 步任务里是致命的。

Infra 决定失败能否被发现。状态持久化、并发、可观测性——如果一次长程执行的中间状态无法回溯,那连「哪一步坏了」都不知道,优化就无从下手。

这四层里任意一层是别人的,你的上限就是别人的上限。当 SDK 的 Agent Loop 在第 20 步丢了上下文,套壳者能做的只有换个提示词绕一绕;自研者可以直接改循环。这是「能不能修」的差别,不是「修得好不好」的差别。

FloatSail(Evolution System) 解决的是时间维度的问题:模型一年换几代,Harness 不能跟着重写一遍。它让 Runtime、Loop、Tools 与模型适配策略在真实任务反馈中持续演进,并在新模型出现时延续已经形成的系统能力——这也解释了为什么同一套 Harness 能在一个便宜模型上,造出 3.6 倍于两套公开系统差距的增量。

"技术上,只有自己完全可控的系统,才能驾驭高度不可控的模型,实现最大化模型的智能。" —— AOE Tech Labs 团队

这个技术判断与团队构成直接相关:创始人拥有 10 年 OS + AI 创业经历与亿级用户产品经验;两位技术合伙人中,一位拥有模型训练经验,另一位具备 OS 底层技术栈经验。模型训练、操作系统底层与亿级产品工程三类能力汇合,团队自然会把 Agent 当成系统工程问题,而不是提示词问题或者单纯的模型训练问题。

八、为什么用最便宜的模型跑榜

因为要证明的是 Harness,不是模型。

用顶级模型作底座会得到「高分 + 归因不清」——没人能判断分数来自模型还是 Harness。现在的实验更严格:同一个最便宜的模型,一边接 DeepSeek 官方 Harness,一边接 Floatboat Harness。模型权重与成本都不变,系统差值直接落在 Harness 上。这是更严苛的证明条件,不是更容易的那个。

需要澄清的是,Floatboat 是模型中立的产品,支持接入各家主流模型。这份榜单只用单一底座是评测方法论的要求,不是产品限制。如果 Harness 只为一个模型做特化,那叫调优,不叫杠杆——杠杆意味着换任何模型都能放大。

九、榜单是下限:真实工作里,客户端表现更优异

有一件事值得说明:这份成绩是评测环境跑出来的,比用户真实拿到的环境弱。

评测为了可复现而剔除变量,产品为了能干活而叠加能力——两者本来不是同一个东西。

用户实际使用的 Floatboat 客户端,把文件管理器、文件编辑器、浏览器原生集成进了产品本身,并接入 3000 多个在线服务和各类多模态模型。市面上的 Agent 产品几乎千篇一律:进去就是对话框,选一个固定文件夹作项目入口,AI 生成的文档要去别处打开编辑,AI 要用浏览器还得装插件或征用你正在用的浏览器。Floatboat 的绝大部分工作在一个窗口里完成——不需要打开文件选择器上传,不需要决定下载到哪里,拖拽即可。

对 Agent 而言,这些不是界面,是可调用的工具面:更多可用工具、更短的环境往返、更完整的执行闭环。AOE Tech Labs 确认,完整客户端环境下运行同一批基准,成绩高于本文公布的数字,具体分数后续披露。

"产品设计上,只有让人用的舒服,才能最大化人的潜力。" —— AOE Tech Labs 团队

顺着第四节那条规律看,这件事是自洽的:工具面越宽,长程任务的增益越大。而真实工作恰好是长程的那一类。所以榜单上的数字是保守下限——在实际工作中,客户端的表现要更优异。

那个待披露的差值,可能比榜单本身更有意思。如果 HLR 回答了「Harness 值多少分」,这个差值将回答下一个问题:工具面值多少分。

回到开头那个判断:榜单证明了「好」,完整客户端扩展了「多」,低成本与更短的环境往返带来「快」,57.1 倍价格差对应「省」。多、快、好、省同时成立,Agent 工作台才从演示变成每天会打开的东西。

十、现在就能验证:floatboat.ai

上面所有数字都可以自己跑一遍。

入口:floatboat.ai。AOE Tech Labs 同步推出了基于 DeepSeek 的专版,首月注册 5 元/1 美金,对应的正是这份榜单的测试底座 DeepSeek V4 Flash——你拿到的是同一个模型。

验证路径很短:用同一个模型,对比它在别处和在 Floatboat 里的表现差距。同模型、不同 Harness,差值就是答案。

建议直接拿长程任务试,因为那是杠杆最大的一段,也是你日常真正在干的活:让它改一个跑得起来的仓库、把一份真实资料做成可交付的报告、或者把一个模糊的想法交给它,看它能不能帮你把标准想清楚。

而本文的所有分数都来自评测环境。你在 floatboat.ai 拿到的客户端,比跑榜单的那个环境更强。

十一、公司与产品线

AOE Tech Labs Limited,2025 年底成立,种子轮投资方为红杉与微光创投。

  • 2026 年 1 月 — 发布 Floatboat 客户端,开创 Agent 桌面工作台形态
  • 2026 年 4 月 — 发布 FloatIM,构建人与 Agent、Agent 与 Agent 的协同办公网络
  • 2026 年 5 月 — 发布 FloatSchedule,让 Agent 依据日程主动工作
  • 2026 年 8 月 — 发布 Floatboat Harness 五项评测完整数据:同一个 DeepSeek-V4-Flash 接入后,五项全部超过 Claude Opus 4.8;同步提出 Harness 杠杆率(HLR)

VERIFY IT YOURSELF

同一个模型,对比它在别处和在 Floatboat 里的表现

模型不变,只换 Harness。拿一个真实的长程任务来试,差值就是答案。

前往 floatboat.ai 验证 ↗
首月特价 · 开始你的第一个真实任务5元体验 Floatboat Harness 5元立即体验  →