TOWOW NEGATIVE RESULT · R5.4

六轮协商,结果仍是 0。

两个被赋予不同约束的 Agent 角色,把规则谈得越来越完整。没有人签字,没有补丁被采用,目标系统也没有验收。

这个 0 指 AcceptedOriginalValue,不是没有研究价值。实验真正留下的是一条更难伪装的分界:谈得更完整,不等于关系已经形成。

6
轮直接 A2A 协商
2.488074×
A2A / static 模型成本
0
所有实验臂 AcceptedOriginalValue

最值得留下的结论

AI 协作最危险的假成功,不是答案写错了,而是把“大家谈得更完整”误当成“现实已经改变”。

01 · ONE REAL TASK, SYNTHETIC AUTHORITIES

这不是一场大规模基准测试。

它是一个真实代码库问题上的单任务对照实验。问题很小,却碰到了跨主体协作最核心的地方:同一个定位符被两个 owner 使用时,一个 owner 的生命周期动作会不会串到另一个 owner。

N = 1
一个真实 Harness 工程任务,不是多任务统计样本。
2 + 1
两个合成 owner 角色与一个 builder。角色拥有不同约束,但不是真实组织主权。
10 calls
主 run 共 10 次模型调用,分配为 static 1、central 3、direct A2A 6。
0 retries
主 run 没有重试。另有一次预注册 central replication,只复现了传输失败。

02 · THREE ROUTES

三条路线,没有赢家。

同一个问题分别交给静态构建、最小权限中心协调和直接 A2A 协商。成本只统计模型调用,时间是调用时长之和,不代表端到端关键路径。

STATIC1 call · 297.3s

静态构建

$0.5401733

它找到了主要缺陷,但补丁格式错误,语义也不完整。没有采用。

发现问题,不等于交付完成
CENTRAL3 calls · 456.3s

最小权限中心

$0.40694895

两个 owner report 成功返回,builder 在生成完整结构化结果时断连,未形成 synthesis。

能力状态:Unknown
DIRECT A2A6 calls · 623.4s

直接协商

$1.3439834

候选合同获得更多拒绝、恢复与争议条款,但停在最后一次 COUNTER。没有签署、补丁或 adoption。

规范更完整,关系未形成
精确成本比

$1.3439834 ÷ $0.5401733 = 2.488074。它只描述这一个任务、这一次配置、验证开销之前的模型成本,不能外推为 A2A 的通用成本。

03 · WHAT CHANGED IN SIX ROUNDS

冲突被说清了,承诺没有出现。

六次消息按 PROPOSE 与 COUNTER 交替。每一轮都增加了可检查内容,但第六轮仍是反条件,而不是签署。

  1. PROPOSE 01

    A 提出复合身份与全局历史兼容。

  2. COUNTER 02

    B 拒绝 wildcard,要求 null-source 隔离与 outcome-scoped 语义。

  3. PROPOSE 03

    A 接受 null-source 类,并枚举七个生命周期 surface。

  4. COUNTER 04

    B 拒绝提前放弃尚未验证机制的补救权。

  5. PROPOSE 05

    A 增加可分割性与有界失效条款。

  6. COUNTER 06

    B 要求权利底线、披露、争议与 reopen。达到调用上限,未签署。

这说明反条件有价值。它们迫使候选规范暴露价值选择,也保存了失败后的恢复路径。但“更像一份合同”仍然不是“合同已经生效”。

04 · TWO PLAUSIBLE SEMANTICS

测试没有给出一个简单的正确答案。

A2A 候选更重视 owner 隔离,既有参考方案保留 wildcard 兼容。两套语义各自在不同测试面上得分,暴露的是价值冲突,不是单纯代码错误。

A2A CANDIDATE3 / 3

null-source 定向检查通过

但既有 core suite 为 39 pass / 2 fail。

REFERENCE ALTERNATIVE0 / 3

同一组 null-source 检查未通过

它自己的 native suite 为 44 / 44。

当“隔离更严格”与“历史兼容更完整”发生冲突时,测试只能呈现后果,不能替 owner 决定哪一种价值应被接受。

05 · WHY THE SCORE STAYED AT ZERO

0 不是沉默,它是一条验收边界。

所有实验架构的 AcceptedOriginalValue 都是 0。这个指标要求原始价值不只出现在文本里,还要获得相应权威接受,并进入目标域的实际采用。三条路线都没有跨过这条边界。

  1. 01

    Proposal

    提出了候选语义

  2. 02

    Counter

    增加了拒绝与条件

  3. 03

    Signature

    没有权威签署

  4. 04

    Adoption

    没有补丁进入目标

  5. 05

    Acceptance

    没有目标域验收

消息数、合同长度和测试片段可以是过程证据,但不能代替签署权、目标采用与现实 Effect。

06 · THE BASELINE DID NOT LOSE

强中心没有输,它的完整输出没有成功传回来。

中心 builder 收到一份 44,979-byte 的冻结 prompt,需要一次返回完整结构化 patch。主运行在约 301.5 秒断连,预注册 replication 又在约 305.3 秒断连。两次都接近五分钟。

可以确认的是这种长结构化输出调用形态发生了可复现 transport failure。不能确认的是强中心缺乏推理能力。它的能力状态必须保留为 Unknown。

下一步应把中心路线改成短决策记录、工具内实现与短验证回报,再按原合同重跑。这个实验尚未完成,所以当前没有公平比较 winner。

07 · TOWOW × FLOWNESS

ToWow 处理形成,Flowness 守住证据。

ToWow

谁有权把提案变成承诺

ToWow 区分 Principal、Authority、RelationVersion、Commitment、Effect 与 Acceptance。六轮消息只有在这些关系上落地,才可能成为共同现实。

Flowness

谁能证明工作真的越过边界

Flowness 保留事件、上下文、Finding、Commit Gate 与目标侧读回。它阻止一个长得很完整的候选合同被过早写成“已完成”。

在可信 Agent 内部,两者可以共用事件、版本和验收骨架。进入不可信网络后,还必须增加身份、隔离、隐私与抗串谋机制。

08 · CLAIM BOUNDARY

这次实验能说明什么,不能说明什么。

可以说明

  • 不同权威角色的拒绝与反条件会实质改变候选规范。
  • 更多消息轮次不会自动产生签署、采用或新能力。
  • 失败的对照组必须保留,不能把对手缺席写成己方胜利。
  • “说得更完整”与“现实中形成了可执行能力”必须分开。

不能说明

  • 不能说 A2A 普遍无效,或普遍比中心贵 2.49 倍。
  • 不能说两个真人、真实组织主权或生产安全隔离已经被测试。
  • 不能说存在生产 adoption、商业净值或长期复用证据。
  • 不能说强中心败北。修正版 transport-safe center 尚未运行。

材料与可复核性

本文使用 R5.4 预注册、experiment record、formation episode、成本记录、验证报告、净值报告与 2026-08-01 当前 settlement 的聚合事实。完整 prompts、raw transcripts、private dossiers、内部身份值和私有代码没有公开。

09 · NEXT EXPERIMENT

下一次实验,必须让“完成”真的有机会发生。

重跑需要 transport-safe center、明确签署权、目标端 patch adoption、关键交互消融、原始价值保留和成本后的净值判断。缺少任何一项,都不能把 formation 写成成功。

返回 ToWow 研究总入口下载公开研究数据了解 Flowness 如何保存证据