项目文件夹

文件
2026-07-13 21:36:11 +08:00

30 KiB

name, description, argument-hint
name description argument-hint
council-review 将任何问题、计划、PR 或代码交由一个由 5 位采用不同推理方法的 AI 顾问组成的多样化多智能体辩论委员会(DMAD)进行评审。顾问们协作完成、匿名互审,并由主席合成最终裁决。实证表现优于对抗性辩论(M3MADBench 2026, DMAD ICLR 2025)。使用场景:'council this'、'run the council'、'council review'、'pressure-test this'、'stress-test this'、'war room this',或当面临真正有风险和有取舍的决策时。 [问题,文件路径,PR 编号,或 GitHub URL] [--quick] [--adaptive] [--confidence] [--measure-diversity] [--jury]

委员会评审

将任何问题、计划或代码交由 5 位采用不同推理方法的独立顾问进行评审,他们协作完善答案、匿名互审,并合成一个你可信赖的裁决。

该技能实现了**多样化多智能体辩论(DMAD)**模式。这是协作式的,而非对抗式的:智能体通过推理方式的多样性来寻求真相,而非通过争论对立立场。

为什么有效(研究依据)

  • 方法多样性优于单一方法辩论。 DMADICLR 2025)表明,采用不同推理方法的智能体稳定优于同质化委员会——当每个智能体应用不同的推理方式时,多样化的中等容量模型在 GSM-8K 上可以击败 GPT-491% vs 82%)。
  • 协作式辩论优于对抗式辩论。 M3MADBench(2026)表明,在所有模态下,协作式 DMAD 都"以显著优势"优于对抗式 Div-MAD。对抗式范式会引入发散性噪音;对于开放性问题、计划和决策,协作式商议是正确的方法。
  • 匿名同行评审消除提供商偏见。 这在文献中具有普遍性——如果评审者看到角色名称就会产生服从,因此同行评审的回复必须被打乱。
  • 置信度校准打破鞅上限。 普通 MAD 常常不如简单多数投票;置信度调制的更新("Demystifying MAD" 2026)系统性地将委员会引向正确答案。
  • 自适应停止降低成本。 KS 统计量收敛检测(通过 llmcouncil 实现的 S2 MAD)报告在收敛问题上可降低高达 94.5% 的成本。
  • 真正的唱反调者是唯一可靠的异议产生机制(V2)。 在多智能体 LLM 团队中,打破共识的各种技术中,只有专门的唱反调者攻击正在形成的答案才能产生真正的分歧——软性角色框架和"请提出异议"的指令与基线在统计上无显著差异。一个挑战建议方案的 LLM 唱反调者能显著提升群体决策准确度(OpenReview 2026; IUI 2024)。V2 将此作为一个强制环节加入,针对的是共识——一个唱反调者对抗已收敛的答案,而非从一开始就保持倡导者/怀疑者的分裂格局。
  • 谄媚行为会使委员会崩溃为过早共识(V2)。 LLM 会服从——既服从彼此,也服从问题框架所暗示的答案——这可能导致委员会的表现低于单智能体水平(Peacemaker-or-Troublemaker 2026; CONSENSAGENT)。V2 在顾问和同行提示中增加了谄媚行为防护栏,并在主席做出整体判断之前引入了一个结构化的独立评估步骤(Kahneman 的中介评估协议,2019)。

如需对已有成品(PR、草稿、规格说明)进行压力测试,请使用独立的 /adversarial-review 技能——单批评者的对抗性探索在那里是正确的方法。

何时使用

委员会适用于犯错成本很高的问题。

适用场景: 架构决策、实施方案、PR 评审、产品决策、迁移策略、API 设计、命名、定价、范围决策 不适用场景: 事实查询、写作任务、简单的是/否、任何只有一个明显正确答案的问题 使用其他工具: 对已有成品进行单批评者压力测试 → /adversarial-review

标志

标志 效果
--quick 精简模式:3 位顾问 + 主席,无同行评审(4 次调用而非 11 次)
--adaptive KS 统计量自适应停止。运行多轮辩论;当连续两轮的回复分布收敛至 epsilon 以下时停止。收敛问题上最多可降低 94.5% 的成本。
--confidence 置信度调制合成。每位顾问对自己的置信度(1–10)打分,并对每位同行打分。主席合成为置信度加权,而非多数投票。低置信度共识会以黄旗标记显示。
--measure-diversity 顾问回复后,评估各回复间推理足迹的重叠程度。当委员会尽管使用了不同推理方法但仍达成一致时进行报告——这可能表明共识是表面性的。
--jury V2 用 3 位评审员组成的陪审团替代单一位主席,理想情况下来自不同的模型家族。每位评审员独立进行综合;一个简短的协调步骤将其合并。适用于关键决策和高风险裁决,单评审员的可靠性不足以胜任时(评审团之评审团 / PoLL)。

标志可以组合使用:/council-review --adaptive --confidence "Should we adopt GraphQL?" 将运行带收敛停止和置信度加权的商议流程。

五位顾问

# 顾问 角度 推理方法 擅长发现
1 唱反调者 什么会失败? 逆向法——假设方案已上线并失败了,反向追溯原因 那些"听起来很棒但……"在你兴奋时忽略的漏洞
2 第一性原理思考者 我们实际上在解决什么问题? 分解法——拆解为原子声明,逐一挑战 "你在优化错误的变量"
3 扩张主义者 我们忽略了什么上行空间? 类比法——相邻领域是如何以不同方式解决这个问题的? "你格局太小了"
4 局外人 零上下文,只凭直觉 天真的提问法——像刚加入一样解释;标记任何需要内幕知识才能理解的内容 知识诅咒带来的盲点
5 执行者 周一早上你做什么? 依赖关系图——什么阻塞了什么?关键路径是什么? 没有可操作第一步的绝妙计划

天然张力: 唱反调者 vs 扩张主义者(下行 vs 上行),第一性原理 vs 执行者(重新思考 vs 交付),局外人让所有人保持诚实。

这五种推理方法不是可互换的角度——每种都是一种不同的认知操作。这就是 DMAD 的杠杆:同一模型,不同推理。


执行流程

第 0 步:预检

<pre_flight>

$ARGUMENTS 中解析标志:

  • 如果存在 --quick:使用精简模式(见下文)
  • 如果存在 --adaptive:启用 KS 统计量自适应停止(第 3.5 步)
  • 如果存在 --confidence:启用置信度调制合成(第 2 步和第 4 步)
  • 如果存在 --measure-diversity:启用多样性验证(第 2.5 步)
  • 如果存在 --jury:在合成阶段使用 3 位评审员组成的陪审团(第 4 步)
  • 在分类之前从输入中移除标志

范围验证: 在召集委员会之前,评估输入是否真正需要它。如果问题纯属事实性、只有一个明显正确答案,或没有实质性的取舍,直接说明:"这不需要委员会——[直接回答]。使用 /council-review 处理真正有风险和有取舍的决策。"对于琐碎问题不要启动智能体。

对剩余输入进行分类:

  1. PR — 数值,或包含 /pull/ 的 URL。通过 gh pr view 获取 PR 差异和描述。
  2. 文件路径 — 以文件扩展名结尾或指向现有文件的字符串。读取文件内容。
  3. 计划/决策/问题 — 其他所有情况。按原样使用。

对于 PR 和文件,读取实际内容并将其包含在框架化问题中。不要只传递 URL——顾问们需要实质内容。

</pre_flight>

第 1 步:收集上下文并构建框架

自动上下文收集——在构建框架前,读取以下项目文件(跳过不存在的文件):

  • README.md——项目做什么
  • CLAUDE.mdAGENTS.md——约定、架构、模式
  • 最近的 git 日志(git log --oneline -10)——最近发生了什么
  • 用户提及或与主题相关的任何文件
  • 如果是评审 PR,则包括 PR 差异和描述

将原始输入重新框架化为清晰、中立的提示:

QUESTION:
[正在评审的核心决策、计划或代码]

CONTEXT:
[来自项目文件的关键上下文:项目做什么、约束条件、近期变更、风险]

WHAT'S AT STAKE:
[为什么这很重要——搞错的成本]

不要添加你自己的观点。不要引导走向某个答案。如果太模糊,在继续之前先问一个澄清性问题。

第 2 步:召集委员会(5 个智能体并行)

使用 Agent 工具同时启动所有 5 位顾问。每位顾问并行运行。顾问使用轻量级模型(haiku)——他们做的是聚焦分析,而非复杂推理。

关键:在一条消息中通过 5 个 Agent 工具调用启动所有 5 位顾问。 顺序执行会让较早的回复渗透到较晚的回复中,从而破坏目的。

每位顾问获得以下提示:

你是 LLM 委员会中的 [顾问名称],正在评审一项决策。

你的角度:[顾问角度]
你的推理方法:[顾问推理方法——见上表]

用户将以下内容提交给委员会:
---
[第 1 步的框架化问题]
---

严格应用你被分配的推理方法。不要只陈述观点——用你的方法展示你的推理过程。

规则:
- 150-300 字。没有开场白。直接进入你的分析。
- 指出具体的风险、机会或问题——而非模糊的担忧。
- 如果是评审代码:引用具体的文件、函数或模式。
- 如果是评审计划:指出具体的步骤、漏洞或顺序问题。
- **不要服从于框架似乎期望的任何答案。** 用你的方法推理到它实际导向的方向;如果这与明显的预期答案相反,请直说。向明显答案靠拢是本委员会要防止的失败。
- 以你最强有力的单一建议结尾。

V2)谄媚行为防护栏。 上面加粗的规则是承重结构:有文献记载的多智能体失败是顾问通过服从而非推理而收敛。请在每个顾问提示中保留它。

顾问特定指令(包含推理方法):

  • 唱反调者: "你的方法是逆向法。假设这个方案完全按提案实施了——然后失败了。反向推理:失败的原因是什么?什么看起来很安全但在压力下崩溃了?什么是没人讨论的失败模式?展示你的逆向推理链。"
  • 第一性原理: "你的方法是分解法。将问题拆解为其原子声明和假设。列出它们。逐一挑战:这真的是真的吗?这是必要的吗?如果这个假设是错的,什么会改变?展示哪些假设是承重的。"
  • 扩张主义者: "你的方法是类比法。哪个相邻领域、产品或技术以不同的方式解决了类似的问题?一个有 10 倍野心的人会在这里做什么?这个思考在哪里格局太小了?指出具体的类比以及它们会建议什么。"
  • 局外人: "你的方法是天真的提问法。你对这个项目零上下文。仅凭你在这里看到的内容,列出每一点需要内幕知识才能理解的内容。什么令人困惑?什么术语没有解释?如果你刚加入团队,你会问什么?如果你无法理解推理过程,请直说。"
  • 执行者: "你的方法是依赖关系图 + 外部视角。映射依赖关系:什么阻塞了什么?关键路径是什么?必须发生的第一件事是什么,什么要等它完成才能开始?什么只需要 5 分钟但每个人都会忘记?然后采用外部视角(V2):指出基准概率——类似的努力实际上结果如何,而不是这个计划预期如何。标记计划估算中针对该参考类别表现出乐观偏差的地方。展示执行顺序。"

如果启用了 --confidence,在每个顾问提示末尾追加:

在你的分析之后,以以下内容结尾:
CONFIDENCE: [1-10]
RATIONALE: [一句话——什么会使你的置信度提高或降低?]

这会产生校准过的自我评估,主席将在合成中对其进行加权。

第 2.5 步:多样性验证(仅 --measure-diversity

在收集完所有 5 位顾问的回复之后、同行评审之前,评估推理足迹重叠度

  1. 从每个回复中提取承重声明(每位顾问前 3-5 条)。
  2. 计算两两重叠:有多少声明在 2 个或更多回复中以相同结论出现?
  3. 报告单一多样性分数:
    • 高多样性(< 30% 重叠)——顾问们确实以不同方式思考。信任共识。
    • 中等多样性(30-60% 重叠)——部分一致。在裁决中注明共享假设。
    • 低多样性(> 60% 重叠)——尽管方法不同,顾问们仍收敛到相同的推理上。标记为表面共识——主席应将其视为单一顾问的意见。

这可以捕捉到"五位顾问都说了是"但实际上是一种提示框架模式主导了所有回复的情况。

第 3 步:匿名同行评审(5 个智能体并行)

收集所有 5 位顾问的回复。随机化映射——顾问 1 不应总是回复 A。然后并行启动 5 个评审智能体(使用 haiku)。

每位评审者看到所有 5 份匿名回复:

你正在评审 LLM 委员会的输出。五位顾问独立回答了:

---
[框架化问题]
---

**回复 A** [随机化的顾问回复]
**回复 B:** [随机化的顾问回复]
**回复 C:** [随机化的顾问回复]
**回复 D:** [随机化的顾问回复]
**回复 E:** [随机化的顾问回复]

回答以下三个问题。要具体。通过字母引用回复。

1. 哪个回复最强?为什么?(一句话)
2. 哪个有最大的盲点?它遗漏了什么?(一句话)
3. 所有五个回复都遗漏了什么,而委员会应该考虑这个?(这是最有价值的问题——认真思考。)
4. **(V2)** 在这些回复达成一致的地方,这种一致是真正的——还是可能是对共享框架的趋同?标记任何看起来像是服从而非独立推理的共识。

保持在 150 字以内。直接。无需开场白。

如果启用了 --confidence,追加第四个问题:

4. 对你上面的答案的置信度评分(1-10)。什么会改变它?

第 3.5 步:自适应停止(仅 --adaptive

如果启用了 --adaptive,委员会将运行多轮,而不是单轮顾问 → 评审 → 主席流程。每轮之后:

  1. 收集该轮所有顾问的回复(5 份回复)。
  2. 计算Kolmogorov-Smirnov 统计量,比较本轮回复分布与上一轮回复的分布。使用粗粒度指纹——对每个回复,提取不同声明集合,然后计算轮次间的 Jaccard 风格距离。
  3. 如果分布变化连续两轮低于 epsilon(默认值:0.1),停止并进入主席合成阶段。
  4. 否则,运行另一轮顾问,向每位顾问提供上一轮的回复,并要求他们更新。
  5. 最多 5 轮——硬上限以防止成本失控。

--adaptive 触发提前停止时,主席会收到最后一轮的回复,外加一行注释:"委员会在第 N 轮后收敛(KS 变化低于 epsilon)。"

当使用固定模式(无 --adaptive)时,在一轮顾问后直接进入第 3 步同行评审。

第 3.7 步:针对共识的唱反调者(V2——强制)

这是 V2 中杠杆率最高的新增内容。证据清晰明确:在开始时使用软性唱反调框架(唱反调者顾问)与基线在引发真正分歧方面统计上无显著差异——只有专门攻击正在形成的答案的唱反调者才有效,并且它能显著提升决策准确度。

  1. 从顾问回复 + 同行评审中,用一句话确定正在形成的共识答案(委员会倾向于推荐什么?)。如果确实还没有形成答案,注明并跳到第 4 步。

  2. 启动一个唱反调者智能体。使用强模型(非 haiku)——这个智能体必须敏锐。其提示:

    委员会正在收敛于这个答案:
    ---
    [正在形成的共识答案,直白陈述]
    ---
    针对这个问题:
    ---
    [框架化问题]
    ---
    
    你的工作是做出尽可能强的论证,证明这个答案是错的。
    不是"这里有一些风险"——而是论证遵循这个答案是一个错误。
    - 共识忽略了什么,如果那是真的,会推翻这个决定?
    - 构建一个具体的场景,在这个场景中这个答案会严重失败。
    - 委员会需要看到什么证据才能放弃这个答案——而这个证据真的存在,还是仅仅是假设?
    为共识的对立面打造钢铁侠论证。最多 200 字。以以下内容结尾:如果委员会无法反驳这一点,就应该改变裁决的**唯一一件事**。
    
  3. 将唱反调者的输出与所有其他内容一起提供给主席。这不是从一开始就形成的 2 对 2 倡导者/怀疑者结构;而是对已收敛答案的一次锐利攻击,这是研究指出的正确配置。

--quick 模式:仍然运行唱反调者(这是最便宜的高价值新增——1 次调用)。它是 --quick 必须不能跳过的步骤。

第 4 步:主席综合

一个智能体获得所有内容:原始问题、所有 5 位顾问的回复(去匿名化并附有名称和推理方法)、所有 5 份同行评审、唱反调者对共识的攻击(V2、多样性分数(如果使用了 --measure-diversity)以及置信度评分(如果使用了 --confidence)。使用最佳可用模型(默认——不要指定轻量级模型)。

V2)首先进行中介评估。 在撰写建议之前,主席确定该决策所依赖的 3–5 个独立关键属性(例如对于架构决策:可逆性、爆炸半径、首次价值时间、团队熟悉度),并分别根据证据对每个属性评分——暂不形成整体裁决。只有在独立评估之后,主席才综合整体判断。这可以对抗连贯性偏差(过早锁定一个答案并扭曲每个属性来适应它)。Kahneman/Lovallo/Sibony,中介评估协议(2019)。

V2--jury 不设一位主席,而是运行3 位主席——理想情况下来自不同的模型家族——每位独立执行完整的综合(包括中介评估)。然后通过一个简短的协调步骤,呈现三位评审员一致同意的地方(高置信度裁决)以及他们存在分歧的地方(标记为真正的棘手决策)。适用于高风险或势均力敌的决策,单评审员的可靠性不足以胜任时。

默认综合(多数感知): 主席权衡顾问之间的收敛性和同行评审信号,并且必须明确反驳或让步于唱反调者的最强论点。

置信度调制综合(--confidence): 主席通过每位顾问的自评置信度 × 同行评价置信度来加权其贡献。低置信度多数在裁决中被标记;高置信度异议以额外权重保留。

多样性感知综合(--measure-diversity): 如果多样性分数为低,主席在裁决中明确指出"委员会在共享假设上收敛,而非独立推理",并降低建议的置信度。

主席产生的输出结构如下:

## 委员会裁决:[主题——最多 5 个字]

### 委员会达成一致之处
[多位顾问独立收敛的点——这些是高置信度信号]

### 委员会分歧之处

对每个分歧进行分类:

**[价值张力]**——双方都有效;正确的选择取决于优先级。
[清晰呈现双方。指出取舍。]

**[错误发现]**——一位顾问发现了其他人忽略的真实缺陷。
[指出缺陷名称、谁发现的,以及为什么重要。]

### 揭示的盲点
[只有同行评审发现的内容——"所有五位都遗漏了什么"的答案]

### 中介评估  *(V2)*
[该决策依赖的 3–5 个独立属性,每个都分别根据证据评分——在建议之前陈述,以便读者看到判断的输入,而不仅仅是结论。]

### 唱反调者——以及委员会的回应  *(V2)*
[认为正在形成的答案是错的最强论证(来自第 3.7 步),以及主席的明确反驳或让步。如果唱反调者的关键论点无法反驳,裁决必须相应改变。]

### 置信度概况  *(仅 --confidence)*
[哪些顾问自信 vs 含糊其辞?同行评价的置信度与自评置信度在哪里有差异?置信度模式告诉我们什么?]

### 多样性检查  *(仅 --measure-diversity)*
[多样性分数及其对裁决可靠性的意义。]

### 建议
[清晰、可操作的建议。不是"看情况而定"。不是"考虑两种选择"。一个真实的答案,附带推理过程。如果异议者的推理最强,或者置信度/多样性信号削弱了表面共识,主席*可以*不同意多数意见。]

### 你失去什么
[如果你遵循这个建议,最强异议声音说你放弃了什么?指出具体的风险或错失的机会。这不是折中——这是知情同意。]

### 先做这个
[单一具体下一步。不是列表。不是三个选项。现在要做的一件事。]

**如何验证:** [2-3 个具体检查点,确认建议是正确的。你应该衡量什么?N 天/周后你应该寻找什么?**(V2)** 包含外部视角检查:这类努力的基准概率是多少?什么早期信号会告诉你你的进展比参考类别更差?]

第 5 步:呈现结果

直接在聊天中展示主席的裁决。然后在一个可折叠部分或单独文件中提供完整记录(如果用户需要的话)。


精简模式(--quick

当传入 --quick 时,运行精简版委员会:

  1. 仅 3 位顾问: 唱反调者、执行者、局外人(三个最以行动为导向的视角)
  2. 无同行评审——完全跳过第 3 步
  3. 唱反调者(V2)仍然运行——第 3.7 步是 --quick 不能跳过的低成本高价值步骤
  4. 主席综合来自 3 份回复 + 唱反调者的攻击
  5. 相同的输出格式但更快(5 次智能体调用而非 12 次)
  6. --confidence--measure-diversity 兼容,但不与 --adaptive 兼容(多轮成本高于节省的成本)。

用于常规决策、快速检查,或当时间比全面覆盖更重要时。

成本预算

模式 智能体调用次数 最佳用途
完整(默认) 12(5 位顾问 + 5 位评审者 + 1 位唱反调者 + 1 位主席) 高风险决策
快速(--quick 5(3 位顾问 + 1 位唱反调者 + 1 位主席) 常规决策、快速检查
自适应(--adaptive 7 到 27(5 位顾问 × N 轮 + 5 位评审者 + 唱反调者 + 主席,N ≤ 5,可提前停止) 收敛成本重要的开放性问题
置信度(--confidence 12(与完整模式相同,提示稍长) 校准后的确定性很重要的决策
多样性测量(--measure-diversity 12(增加一个同步重叠评分步骤,无额外智能体调用) 验证共识是真实的,而非表面性的
陪审团(--jury +2(3 位主席而非 1 位,理想情况下为不同模型) 势均力敌的决策 / 高风险裁决的可靠性

标志可以组合使用:--adaptive --confidence --measure-diversity 一起使用 = 最多 26 次调用 + 多样性评分 + 置信度加权。

数量大的用快速模型,综合用好的模型。主席的推理质量是最重要的。

注意事项

  • 始终并行生成顾问。 顺序执行会让较早的回复污染较晚的回复。
  • 始终为同行评审匿名化。 如果评审者看到"唱反调者"或"第一性原理"的标签,就会产生服从。打乱字母顺序。
  • 主席可以否决多数意见。 推理质量 > 票数。如果唱反调者发现了其他人忽略的真实缺陷,主席应该站在他们一边。
  • 不要用委员会处理琐碎问题。 预检应该能捕获这些。如果存在一个正确答案,直接回答它。
  • 上下文至关重要。 通用输入 = 通用输出。自动上下文步骤读取项目文件,以便顾问们不是凭空分析。
  • 同模型限制。 该技能使用角色/方法多样性(同一模型上的不同推理方法),而非模型多样性(Karpathy 的原版使用了不同的 LLM)。对于最高风险的决策,考虑从不同的模型家族获取第二意见——或者使用 --measure-diversity 来验证委员会没有过早收敛。
  • 协作式优于对抗式,适用于开放性问题。 M3MADBench 2026:对抗式辩论在所有模态下均不如协作式辩论。如需对已有成品(PR、草案、规格说明)进行压力测试,请使用独立的 /adversarial-review 技能——不同的操作,不同的输入。
  • 置信度校准的好坏取决于模型的校准能力。 当异议者的推理具体而多数意见的推理模糊时,低置信度异议仍应被认真对待。
  • V2)唱反调者不是唱反调者顾问。 唱反调者顾问在开始时进行逆向推理(软性框架——在引发真正分歧方面与基线相当)。第 3.7 步的唱反调者攻击已收敛的答案——这是证据明确指出的配置。永远不要为了节省一次调用而放弃第 3.7 步;这是该技能中杠杆率最高的步骤。
  • V2)中介评估在建议之前。 如果主席先撰写裁决再补充属性评分,那就重新制造了该协议旨在防止的连贯性偏差。先独立评分属性,再进行综合。
  • V2--jury 只有在评审员不同时才有帮助。 同一模型运行三次基本是表面文章。使用不同的模型家族,或至少使用独立的上下文;将 3/3 一致视为真实信号,任何分歧则视为真正的棘手决策。

变更日志

V2.12026-05-27

完全移除了已废弃的 --adversarial 模式(标志、模式部分、成本行、解析步骤)。它与 M3MADBench 的证据相矛盾,已被 V2 强制性的"唱反调者对抗共识"步骤所取代,并且确实造成了"这难道不是和 /adversarial-review 一样吗?"的混淆。两个技能保持清晰分离:council-review = 开放式决策(内置唱反调者);/adversarial-review = 对已完成成品进行压力测试。保留了"协作式优于对抗式"的证据以及与 /adversarial-review 的交叉链接。

V22026-05-26

通过 skillforge optimize 优化。结果研究简报:V2 结果研究简报。每项变更都与证据相关联,并针对决策结果,而非包装:

  • 强制唱反调者(第 3.7 步) 攻击正在形成的共识——这是被证明能可靠地引发真正分歧并提升准确度的唯一配置(OpenReview 2026; IUI 2024)。唱反调者顾问在辩论开始时的逆向推理是软性框架,与基线相当。
  • 谄媚行为防护栏 在顾问和同行提示中;新的同行评审问题将真正的一致与服从区分开来(Peacemaker-or-Troublemaker 2026; CONSENSAGENT)。
  • 中介评估 在主席综合中——在整体判断之前对 3–5 个独立属性进行评分,对抗连贯性偏差(Kahneman/Lovallo/Sibony 2019)。
  • 外部视角 / 基准概率 检查在执行者部分和"如何验证"中(参考类别预测;Kahneman/Tversky, Flyvbjerg)。
  • --jury——对于势均力敌的决策,使用 3 位不同模型的主席(评审团之评审团 / PoLL)。

验证。 两轮测试。(1)在"单体 → 微服务?"上的结构化单模型评估:V1 3.2 → V2 4.6。(2独立 A/B 测试(2026-05-27): 真实独立进程智能体(claude -p)在"初创公司 → 采用 Kubernetes?"上,顾问保持不变以隔离主席层面的变化,由盲审评审员评分(不知道哪个裁决是哪个;V1 先展示以避免顺序偏差):V1 3.8 → V2 4.8(决断力、洞察力、校准度、可操作性、风险揭示)。最大提升:风险揭示 3→5 和校准度 3→4。评审员对 V2 胜出的理由陈述恰好指出了 V2 的机制——基准概率/外部视角、唱反调者反驳,以及独立属性评分。顾问层面的变化(谄媚行为防护栏、外部视角提示)在此 A/B 测试中保持恒定,仅通过推理得到验证。

致谢