30 KiB
name, description, argument-hint
| name | description | argument-hint |
|---|---|---|
| council-review | 将任何问题、计划、PR 或代码交由一个由 5 位采用不同推理方法的 AI 顾问组成的多样化多智能体辩论委员会(DMAD)进行评审。顾问们协作完成、匿名互审,并由主席合成最终裁决。实证表现优于对抗性辩论(M3MADBench 2026, DMAD ICLR 2025)。使用场景:'council this'、'run the council'、'council review'、'pressure-test this'、'stress-test this'、'war room this',或当面临真正有风险和有取舍的决策时。 | [问题,文件路径,PR 编号,或 GitHub URL] [--quick] [--adaptive] [--confidence] [--measure-diversity] [--jury] |
委员会评审
将任何问题、计划或代码交由 5 位采用不同推理方法的独立顾问进行评审,他们协作完善答案、匿名互审,并合成一个你可信赖的裁决。
该技能实现了**多样化多智能体辩论(DMAD)**模式。这是协作式的,而非对抗式的:智能体通过推理方式的多样性来寻求真相,而非通过争论对立立场。
为什么有效(研究依据)
- 方法多样性优于单一方法辩论。 DMAD(ICLR 2025)表明,采用不同推理方法的智能体稳定优于同质化委员会——当每个智能体应用不同的推理方式时,多样化的中等容量模型在 GSM-8K 上可以击败 GPT-4(91% vs 82%)。
- 协作式辩论优于对抗式辩论。 M3MADBench(2026)表明,在所有模态下,协作式 DMAD 都"以显著优势"优于对抗式 Div-MAD。对抗式范式会引入发散性噪音;对于开放性问题、计划和决策,协作式商议是正确的方法。
- 匿名同行评审消除提供商偏见。 这在文献中具有普遍性——如果评审者看到角色名称就会产生服从,因此同行评审的回复必须被打乱。
- 置信度校准打破鞅上限。 普通 MAD 常常不如简单多数投票;置信度调制的更新("Demystifying MAD" 2026)系统性地将委员会引向正确答案。
- 自适应停止降低成本。 KS 统计量收敛检测(通过 llmcouncil 实现的 S2 MAD)报告在收敛问题上可降低高达 94.5% 的成本。
- 真正的唱反调者是唯一可靠的异议产生机制(V2)。 在多智能体 LLM 团队中,打破共识的各种技术中,只有专门的唱反调者攻击正在形成的答案才能产生真正的分歧——软性角色框架和"请提出异议"的指令与基线在统计上无显著差异。一个挑战建议方案的 LLM 唱反调者能显著提升群体决策准确度(OpenReview 2026; IUI 2024)。V2 将此作为一个强制环节加入,针对的是共识——一个唱反调者对抗已收敛的答案,而非从一开始就保持倡导者/怀疑者的分裂格局。
- 谄媚行为会使委员会崩溃为过早共识(V2)。 LLM 会服从——既服从彼此,也服从问题框架所暗示的答案——这可能导致委员会的表现低于单智能体水平(Peacemaker-or-Troublemaker 2026; CONSENSAGENT)。V2 在顾问和同行提示中增加了谄媚行为防护栏,并在主席做出整体判断之前引入了一个结构化的独立评估步骤(Kahneman 的中介评估协议,2019)。
如需对已有成品(PR、草稿、规格说明)进行压力测试,请使用独立的 /adversarial-review 技能——单批评者的对抗性探索在那里是正确的方法。
何时使用
委员会适用于犯错成本很高的问题。
适用场景: 架构决策、实施方案、PR 评审、产品决策、迁移策略、API 设计、命名、定价、范围决策
不适用场景: 事实查询、写作任务、简单的是/否、任何只有一个明显正确答案的问题
使用其他工具: 对已有成品进行单批评者压力测试 → /adversarial-review
标志
| 标志 | 效果 |
|---|---|
--quick |
精简模式:3 位顾问 + 主席,无同行评审(4 次调用而非 11 次) |
--adaptive |
KS 统计量自适应停止。运行多轮辩论;当连续两轮的回复分布收敛至 epsilon 以下时停止。收敛问题上最多可降低 94.5% 的成本。 |
--confidence |
置信度调制合成。每位顾问对自己的置信度(1–10)打分,并对每位同行打分。主席合成为置信度加权,而非多数投票。低置信度共识会以黄旗标记显示。 |
--measure-diversity |
顾问回复后,评估各回复间推理足迹的重叠程度。当委员会尽管使用了不同推理方法但仍达成一致时进行报告——这可能表明共识是表面性的。 |
--jury |
(V2) 用 3 位评审员组成的陪审团替代单一位主席,理想情况下来自不同的模型家族。每位评审员独立进行综合;一个简短的协调步骤将其合并。适用于关键决策和高风险裁决,单评审员的可靠性不足以胜任时(评审团之评审团 / PoLL)。 |
标志可以组合使用:/council-review --adaptive --confidence "Should we adopt GraphQL?" 将运行带收敛停止和置信度加权的商议流程。
五位顾问
| # | 顾问 | 角度 | 推理方法 | 擅长发现 |
|---|---|---|---|---|
| 1 | 唱反调者 | 什么会失败? | 逆向法——假设方案已上线并失败了,反向追溯原因 | 那些"听起来很棒但……"在你兴奋时忽略的漏洞 |
| 2 | 第一性原理思考者 | 我们实际上在解决什么问题? | 分解法——拆解为原子声明,逐一挑战 | "你在优化错误的变量" |
| 3 | 扩张主义者 | 我们忽略了什么上行空间? | 类比法——相邻领域是如何以不同方式解决这个问题的? | "你格局太小了" |
| 4 | 局外人 | 零上下文,只凭直觉 | 天真的提问法——像刚加入一样解释;标记任何需要内幕知识才能理解的内容 | 知识诅咒带来的盲点 |
| 5 | 执行者 | 周一早上你做什么? | 依赖关系图——什么阻塞了什么?关键路径是什么? | 没有可操作第一步的绝妙计划 |
天然张力: 唱反调者 vs 扩张主义者(下行 vs 上行),第一性原理 vs 执行者(重新思考 vs 交付),局外人让所有人保持诚实。
这五种推理方法不是可互换的角度——每种都是一种不同的认知操作。这就是 DMAD 的杠杆:同一模型,不同推理。
执行流程
第 0 步:预检
<pre_flight>
从 $ARGUMENTS 中解析标志:
- 如果存在
--quick:使用精简模式(见下文) - 如果存在
--adaptive:启用 KS 统计量自适应停止(第 3.5 步) - 如果存在
--confidence:启用置信度调制合成(第 2 步和第 4 步) - 如果存在
--measure-diversity:启用多样性验证(第 2.5 步) - 如果存在
--jury:在合成阶段使用 3 位评审员组成的陪审团(第 4 步) - 在分类之前从输入中移除标志
范围验证: 在召集委员会之前,评估输入是否真正需要它。如果问题纯属事实性、只有一个明显正确答案,或没有实质性的取舍,直接说明:"这不需要委员会——[直接回答]。使用 /council-review 处理真正有风险和有取舍的决策。"对于琐碎问题不要启动智能体。
对剩余输入进行分类:
- PR — 数值,或包含
/pull/的 URL。通过gh pr view获取 PR 差异和描述。 - 文件路径 — 以文件扩展名结尾或指向现有文件的字符串。读取文件内容。
- 计划/决策/问题 — 其他所有情况。按原样使用。
对于 PR 和文件,读取实际内容并将其包含在框架化问题中。不要只传递 URL——顾问们需要实质内容。
</pre_flight>
第 1 步:收集上下文并构建框架
自动上下文收集——在构建框架前,读取以下项目文件(跳过不存在的文件):
README.md——项目做什么CLAUDE.md或AGENTS.md——约定、架构、模式- 最近的 git 日志(
git log --oneline -10)——最近发生了什么 - 用户提及或与主题相关的任何文件
- 如果是评审 PR,则包括 PR 差异和描述
将原始输入重新框架化为清晰、中立的提示:
QUESTION:
[正在评审的核心决策、计划或代码]
CONTEXT:
[来自项目文件的关键上下文:项目做什么、约束条件、近期变更、风险]
WHAT'S AT STAKE:
[为什么这很重要——搞错的成本]
不要添加你自己的观点。不要引导走向某个答案。如果太模糊,在继续之前先问一个澄清性问题。
第 2 步:召集委员会(5 个智能体并行)
使用 Agent 工具同时启动所有 5 位顾问。每位顾问并行运行。顾问使用轻量级模型(haiku)——他们做的是聚焦分析,而非复杂推理。
关键:在一条消息中通过 5 个 Agent 工具调用启动所有 5 位顾问。 顺序执行会让较早的回复渗透到较晚的回复中,从而破坏目的。
每位顾问获得以下提示:
你是 LLM 委员会中的 [顾问名称],正在评审一项决策。
你的角度:[顾问角度]
你的推理方法:[顾问推理方法——见上表]
用户将以下内容提交给委员会:
---
[第 1 步的框架化问题]
---
严格应用你被分配的推理方法。不要只陈述观点——用你的方法展示你的推理过程。
规则:
- 150-300 字。没有开场白。直接进入你的分析。
- 指出具体的风险、机会或问题——而非模糊的担忧。
- 如果是评审代码:引用具体的文件、函数或模式。
- 如果是评审计划:指出具体的步骤、漏洞或顺序问题。
- **不要服从于框架似乎期望的任何答案。** 用你的方法推理到它实际导向的方向;如果这与明显的预期答案相反,请直说。向明显答案靠拢是本委员会要防止的失败。
- 以你最强有力的单一建议结尾。
(V2)谄媚行为防护栏。 上面加粗的规则是承重结构:有文献记载的多智能体失败是顾问通过服从而非推理而收敛。请在每个顾问提示中保留它。
顾问特定指令(包含推理方法):
- 唱反调者: "你的方法是逆向法。假设这个方案完全按提案实施了——然后失败了。反向推理:失败的原因是什么?什么看起来很安全但在压力下崩溃了?什么是没人讨论的失败模式?展示你的逆向推理链。"
- 第一性原理: "你的方法是分解法。将问题拆解为其原子声明和假设。列出它们。逐一挑战:这真的是真的吗?这是必要的吗?如果这个假设是错的,什么会改变?展示哪些假设是承重的。"
- 扩张主义者: "你的方法是类比法。哪个相邻领域、产品或技术以不同的方式解决了类似的问题?一个有 10 倍野心的人会在这里做什么?这个思考在哪里格局太小了?指出具体的类比以及它们会建议什么。"
- 局外人: "你的方法是天真的提问法。你对这个项目零上下文。仅凭你在这里看到的内容,列出每一点需要内幕知识才能理解的内容。什么令人困惑?什么术语没有解释?如果你刚加入团队,你会问什么?如果你无法理解推理过程,请直说。"
- 执行者: "你的方法是依赖关系图 + 外部视角。映射依赖关系:什么阻塞了什么?关键路径是什么?必须发生的第一件事是什么,什么要等它完成才能开始?什么只需要 5 分钟但每个人都会忘记?然后采用外部视角(V2):指出基准概率——类似的努力实际上结果如何,而不是这个计划预期如何。标记计划估算中针对该参考类别表现出乐观偏差的地方。展示执行顺序。"
如果启用了 --confidence,在每个顾问提示末尾追加:
在你的分析之后,以以下内容结尾:
CONFIDENCE: [1-10]
RATIONALE: [一句话——什么会使你的置信度提高或降低?]
这会产生校准过的自我评估,主席将在合成中对其进行加权。
第 2.5 步:多样性验证(仅 --measure-diversity)
在收集完所有 5 位顾问的回复之后、同行评审之前,评估推理足迹重叠度:
- 从每个回复中提取承重声明(每位顾问前 3-5 条)。
- 计算两两重叠:有多少声明在 2 个或更多回复中以相同结论出现?
- 报告单一多样性分数:
- 高多样性(< 30% 重叠)——顾问们确实以不同方式思考。信任共识。
- 中等多样性(30-60% 重叠)——部分一致。在裁决中注明共享假设。
- 低多样性(> 60% 重叠)——尽管方法不同,顾问们仍收敛到相同的推理上。标记为表面共识——主席应将其视为单一顾问的意见。
这可以捕捉到"五位顾问都说了是"但实际上是一种提示框架模式主导了所有回复的情况。
第 3 步:匿名同行评审(5 个智能体并行)
收集所有 5 位顾问的回复。随机化映射——顾问 1 不应总是回复 A。然后并行启动 5 个评审智能体(使用 haiku)。
每位评审者看到所有 5 份匿名回复:
你正在评审 LLM 委员会的输出。五位顾问独立回答了:
---
[框架化问题]
---
**回复 A:** [随机化的顾问回复]
**回复 B:** [随机化的顾问回复]
**回复 C:** [随机化的顾问回复]
**回复 D:** [随机化的顾问回复]
**回复 E:** [随机化的顾问回复]
回答以下三个问题。要具体。通过字母引用回复。
1. 哪个回复最强?为什么?(一句话)
2. 哪个有最大的盲点?它遗漏了什么?(一句话)
3. 所有五个回复都遗漏了什么,而委员会应该考虑这个?(这是最有价值的问题——认真思考。)
4. **(V2)** 在这些回复达成一致的地方,这种一致是真正的——还是可能是对共享框架的趋同?标记任何看起来像是服从而非独立推理的共识。
保持在 150 字以内。直接。无需开场白。
如果启用了 --confidence,追加第四个问题:
4. 对你上面的答案的置信度评分(1-10)。什么会改变它?
第 3.5 步:自适应停止(仅 --adaptive)
如果启用了 --adaptive,委员会将运行多轮,而不是单轮顾问 → 评审 → 主席流程。每轮之后:
- 收集该轮所有顾问的回复(5 份回复)。
- 计算Kolmogorov-Smirnov 统计量,比较本轮回复分布与上一轮回复的分布。使用粗粒度指纹——对每个回复,提取不同声明集合,然后计算轮次间的 Jaccard 风格距离。
- 如果分布变化连续两轮低于 epsilon(默认值:0.1),停止并进入主席合成阶段。
- 否则,运行另一轮顾问,向每位顾问提供上一轮的回复,并要求他们更新。
- 最多 5 轮——硬上限以防止成本失控。
当 --adaptive 触发提前停止时,主席会收到最后一轮的回复,外加一行注释:"委员会在第 N 轮后收敛(KS 变化低于 epsilon)。"
当使用固定模式(无 --adaptive)时,在一轮顾问后直接进入第 3 步同行评审。
第 3.7 步:针对共识的唱反调者(V2——强制)
这是 V2 中杠杆率最高的新增内容。证据清晰明确:在开始时使用软性唱反调框架(唱反调者顾问)与基线在引发真正分歧方面统计上无显著差异——只有专门攻击正在形成的答案的唱反调者才有效,并且它能显著提升决策准确度。
-
从顾问回复 + 同行评审中,用一句话确定正在形成的共识答案(委员会倾向于推荐什么?)。如果确实还没有形成答案,注明并跳到第 4 步。
-
启动一个唱反调者智能体。使用强模型(非
haiku)——这个智能体必须敏锐。其提示:委员会正在收敛于这个答案: --- [正在形成的共识答案,直白陈述] --- 针对这个问题: --- [框架化问题] --- 你的工作是做出尽可能强的论证,证明这个答案是错的。 不是"这里有一些风险"——而是论证遵循这个答案是一个错误。 - 共识忽略了什么,如果那是真的,会推翻这个决定? - 构建一个具体的场景,在这个场景中这个答案会严重失败。 - 委员会需要看到什么证据才能放弃这个答案——而这个证据真的存在,还是仅仅是假设? 为共识的对立面打造钢铁侠论证。最多 200 字。以以下内容结尾:如果委员会无法反驳这一点,就应该改变裁决的**唯一一件事**。 -
将唱反调者的输出与所有其他内容一起提供给主席。这不是从一开始就形成的 2 对 2 倡导者/怀疑者结构;而是对已收敛答案的一次锐利攻击,这是研究指出的正确配置。
--quick 模式:仍然运行唱反调者(这是最便宜的高价值新增——1 次调用)。它是 --quick 必须不能跳过的步骤。
第 4 步:主席综合
一个智能体获得所有内容:原始问题、所有 5 位顾问的回复(去匿名化并附有名称和推理方法)、所有 5 份同行评审、唱反调者对共识的攻击(V2)、多样性分数(如果使用了 --measure-diversity)以及置信度评分(如果使用了 --confidence)。使用最佳可用模型(默认——不要指定轻量级模型)。
(V2)首先进行中介评估。 在撰写建议之前,主席确定该决策所依赖的 3–5 个独立关键属性(例如对于架构决策:可逆性、爆炸半径、首次价值时间、团队熟悉度),并分别根据证据对每个属性评分——暂不形成整体裁决。只有在独立评估之后,主席才综合整体判断。这可以对抗连贯性偏差(过早锁定一个答案并扭曲每个属性来适应它)。Kahneman/Lovallo/Sibony,中介评估协议(2019)。
(V2)--jury: 不设一位主席,而是运行3 位主席——理想情况下来自不同的模型家族——每位独立执行完整的综合(包括中介评估)。然后通过一个简短的协调步骤,呈现三位评审员一致同意的地方(高置信度裁决)以及他们存在分歧的地方(标记为真正的棘手决策)。适用于高风险或势均力敌的决策,单评审员的可靠性不足以胜任时。
默认综合(多数感知): 主席权衡顾问之间的收敛性和同行评审信号,并且必须明确反驳或让步于唱反调者的最强论点。
置信度调制综合(--confidence): 主席通过每位顾问的自评置信度 × 同行评价置信度来加权其贡献。低置信度多数在裁决中被标记;高置信度异议以额外权重保留。
多样性感知综合(--measure-diversity): 如果多样性分数为低,主席在裁决中明确指出"委员会在共享假设上收敛,而非独立推理",并降低建议的置信度。
主席产生的输出结构如下:
## 委员会裁决:[主题——最多 5 个字]
### 委员会达成一致之处
[多位顾问独立收敛的点——这些是高置信度信号]
### 委员会分歧之处
对每个分歧进行分类:
**[价值张力]**——双方都有效;正确的选择取决于优先级。
[清晰呈现双方。指出取舍。]
**[错误发现]**——一位顾问发现了其他人忽略的真实缺陷。
[指出缺陷名称、谁发现的,以及为什么重要。]
### 揭示的盲点
[只有同行评审发现的内容——"所有五位都遗漏了什么"的答案]
### 中介评估 *(V2)*
[该决策依赖的 3–5 个独立属性,每个都分别根据证据评分——在建议之前陈述,以便读者看到判断的输入,而不仅仅是结论。]
### 唱反调者——以及委员会的回应 *(V2)*
[认为正在形成的答案是错的最强论证(来自第 3.7 步),以及主席的明确反驳或让步。如果唱反调者的关键论点无法反驳,裁决必须相应改变。]
### 置信度概况 *(仅 --confidence)*
[哪些顾问自信 vs 含糊其辞?同行评价的置信度与自评置信度在哪里有差异?置信度模式告诉我们什么?]
### 多样性检查 *(仅 --measure-diversity)*
[多样性分数及其对裁决可靠性的意义。]
### 建议
[清晰、可操作的建议。不是"看情况而定"。不是"考虑两种选择"。一个真实的答案,附带推理过程。如果异议者的推理最强,或者置信度/多样性信号削弱了表面共识,主席*可以*不同意多数意见。]
### 你失去什么
[如果你遵循这个建议,最强异议声音说你放弃了什么?指出具体的风险或错失的机会。这不是折中——这是知情同意。]
### 先做这个
[单一具体下一步。不是列表。不是三个选项。现在要做的一件事。]
**如何验证:** [2-3 个具体检查点,确认建议是正确的。你应该衡量什么?N 天/周后你应该寻找什么?**(V2)** 包含外部视角检查:这类努力的基准概率是多少?什么早期信号会告诉你你的进展比参考类别更差?]
第 5 步:呈现结果
直接在聊天中展示主席的裁决。然后在一个可折叠部分或单独文件中提供完整记录(如果用户需要的话)。
精简模式(--quick)
当传入 --quick 时,运行精简版委员会:
- 仅 3 位顾问: 唱反调者、执行者、局外人(三个最以行动为导向的视角)
- 无同行评审——完全跳过第 3 步
- 唱反调者(V2)仍然运行——第 3.7 步是
--quick不能跳过的低成本高价值步骤 - 主席综合来自 3 份回复 + 唱反调者的攻击
- 相同的输出格式但更快(5 次智能体调用而非 12 次)
- 与
--confidence和--measure-diversity兼容,但不与--adaptive兼容(多轮成本高于节省的成本)。
用于常规决策、快速检查,或当时间比全面覆盖更重要时。
成本预算
| 模式 | 智能体调用次数 | 最佳用途 |
|---|---|---|
| 完整(默认) | 12(5 位顾问 + 5 位评审者 + 1 位唱反调者 + 1 位主席) | 高风险决策 |
快速(--quick) |
5(3 位顾问 + 1 位唱反调者 + 1 位主席) | 常规决策、快速检查 |
自适应(--adaptive) |
7 到 27(5 位顾问 × N 轮 + 5 位评审者 + 唱反调者 + 主席,N ≤ 5,可提前停止) | 收敛成本重要的开放性问题 |
置信度(--confidence) |
12(与完整模式相同,提示稍长) | 校准后的确定性很重要的决策 |
多样性测量(--measure-diversity) |
12(增加一个同步重叠评分步骤,无额外智能体调用) | 验证共识是真实的,而非表面性的 |
陪审团(--jury) |
+2(3 位主席而非 1 位,理想情况下为不同模型) | 势均力敌的决策 / 高风险裁决的可靠性 |
标志可以组合使用:--adaptive --confidence --measure-diversity 一起使用 = 最多 26 次调用 + 多样性评分 + 置信度加权。
数量大的用快速模型,综合用好的模型。主席的推理质量是最重要的。
注意事项
- 始终并行生成顾问。 顺序执行会让较早的回复污染较晚的回复。
- 始终为同行评审匿名化。 如果评审者看到"唱反调者"或"第一性原理"的标签,就会产生服从。打乱字母顺序。
- 主席可以否决多数意见。 推理质量 > 票数。如果唱反调者发现了其他人忽略的真实缺陷,主席应该站在他们一边。
- 不要用委员会处理琐碎问题。 预检应该能捕获这些。如果存在一个正确答案,直接回答它。
- 上下文至关重要。 通用输入 = 通用输出。自动上下文步骤读取项目文件,以便顾问们不是凭空分析。
- 同模型限制。 该技能使用角色/方法多样性(同一模型上的不同推理方法),而非模型多样性(Karpathy 的原版使用了不同的 LLM)。对于最高风险的决策,考虑从不同的模型家族获取第二意见——或者使用
--measure-diversity来验证委员会没有过早收敛。 - 协作式优于对抗式,适用于开放性问题。 M3MADBench 2026:对抗式辩论在所有模态下均不如协作式辩论。如需对已有成品(PR、草案、规格说明)进行压力测试,请使用独立的
/adversarial-review技能——不同的操作,不同的输入。 - 置信度校准的好坏取决于模型的校准能力。 当异议者的推理具体而多数意见的推理模糊时,低置信度异议仍应被认真对待。
- (V2)唱反调者不是唱反调者顾问。 唱反调者顾问在开始时进行逆向推理(软性框架——在引发真正分歧方面与基线相当)。第 3.7 步的唱反调者攻击已收敛的答案——这是证据明确指出的配置。永远不要为了节省一次调用而放弃第 3.7 步;这是该技能中杠杆率最高的步骤。
- (V2)中介评估在建议之前。 如果主席先撰写裁决再补充属性评分,那就重新制造了该协议旨在防止的连贯性偏差。先独立评分属性,再进行综合。
- (V2)
--jury只有在评审员不同时才有帮助。 同一模型运行三次基本是表面文章。使用不同的模型家族,或至少使用独立的上下文;将 3/3 一致视为真实信号,任何分歧则视为真正的棘手决策。
变更日志
V2.1(2026-05-27)
完全移除了已废弃的 --adversarial 模式(标志、模式部分、成本行、解析步骤)。它与 M3MADBench 的证据相矛盾,已被 V2 强制性的"唱反调者对抗共识"步骤所取代,并且确实造成了"这难道不是和 /adversarial-review 一样吗?"的混淆。两个技能保持清晰分离:council-review = 开放式决策(内置唱反调者);/adversarial-review = 对已完成成品进行压力测试。保留了"协作式优于对抗式"的证据以及与 /adversarial-review 的交叉链接。
V2(2026-05-26)
通过 skillforge optimize 优化。结果研究简报:V2 结果研究简报。每项变更都与证据相关联,并针对决策结果,而非包装:
- 强制唱反调者(第 3.7 步) 攻击正在形成的共识——这是被证明能可靠地引发真正分歧并提升准确度的唯一配置(OpenReview 2026; IUI 2024)。唱反调者顾问在辩论开始时的逆向推理是软性框架,与基线相当。
- 谄媚行为防护栏 在顾问和同行提示中;新的同行评审问题将真正的一致与服从区分开来(Peacemaker-or-Troublemaker 2026; CONSENSAGENT)。
- 中介评估 在主席综合中——在整体判断之前对 3–5 个独立属性进行评分,对抗连贯性偏差(Kahneman/Lovallo/Sibony 2019)。
- 外部视角 / 基准概率 检查在执行者部分和"如何验证"中(参考类别预测;Kahneman/Tversky, Flyvbjerg)。
--jury——对于势均力敌的决策,使用 3 位不同模型的主席(评审团之评审团 / PoLL)。
验证。 两轮测试。(1)在"单体 → 微服务?"上的结构化单模型评估:V1 3.2 → V2 4.6。(2)独立 A/B 测试(2026-05-27): 真实独立进程智能体(claude -p)在"初创公司 → 采用 Kubernetes?"上,顾问保持不变以隔离主席层面的变化,由盲审评审员评分(不知道哪个裁决是哪个;V1 先展示以避免顺序偏差):V1 3.8 → V2 4.8(决断力、洞察力、校准度、可操作性、风险揭示)。最大提升:风险揭示 3→5 和校准度 3→4。评审员对 V2 胜出的理由陈述恰好指出了 V2 的机制——基准概率/外部视角、唱反调者反驳,以及独立属性评分。顾问层面的变化(谄媚行为防护栏、外部视角提示)在此 A/B 测试中保持恒定,仅通过推理得到验证。
致谢
- 原始概念:Andrej Karpathy(LLM Council)
- Claude Code 适配:Ole Lehmann(@itsolelehmann)
- 推理方法多样性:DMAD(ICLR 2025)
- 协作式 > 对抗式的实证证据:M3MADBench(arXiv 2601.02854, 2026)
- 置信度调制辩论协议:Demystifying MAD(arXiv 2601.19921, 2026)
- KS 统计量自适应停止:rachittshah/llmcouncil(S2 MAD 实现)
- 多样性足迹验证方法:Counsel(Same model, same blind spots)
- (V2)唱反调者是唯一可靠的异议产生机制: Inducing Disagreement in Multi-Agent LLM Executive Teams (OpenReview 2026); LLM-Powered Devil's Advocate (IUI 2024)
- (V2)谄媚行为 / 过早共识: Peacemaker or Troublemaker (2026); CONSENSAGENT (ACL 2025)
- (V2)中介评估协议: Kahneman, Lovallo & Sibony, A Structured Approach to Strategic Decisions (MIT SMR, 2019)
- (V2)外部视角 / 参考类别预测: Kahneman & Tversky; Flyvbjerg
- (V2)评审团之评审团: LLM-as-Judge best practices 2026(PoLL 风格面板)
- V2 优化过程和结果研究:V2 结果研究简报
- 技能作者:Neal Meyer