--- name: council-review description: "将任何问题、计划、PR 或代码交由一个由 5 位采用不同推理方法的 AI 顾问组成的多样化多智能体辩论委员会(DMAD)进行评审。顾问们协作完成、匿名互审,并由主席合成最终裁决。实证表现优于对抗性辩论(M3MADBench 2026, DMAD ICLR 2025)。使用场景:'council this'、'run the council'、'council review'、'pressure-test this'、'stress-test this'、'war room this',或当面临真正有风险和有取舍的决策时。" argument-hint: "[问题,文件路径,PR 编号,或 GitHub URL] [--quick] [--adaptive] [--confidence] [--measure-diversity] [--jury]" --- # 委员会评审 将任何问题、计划或代码交由 5 位采用**不同推理方法**的独立顾问进行评审,他们协作完善答案、匿名互审,并合成一个你可信赖的裁决。 该技能实现了**多样化多智能体辩论(DMAD)**模式。这是协作式的,而非对抗式的:智能体通过推理方式的多样性来寻求真相,而非通过争论对立立场。 ## 为什么有效(研究依据) - **方法多样性优于单一方法辩论。** DMAD(ICLR 2025)表明,采用不同推理方法的智能体稳定优于同质化委员会——当每个智能体应用不同的推理方式时,多样化的中等容量模型在 GSM-8K 上可以击败 GPT-4(91% vs 82%)。 - **协作式辩论优于对抗式辩论。** M3MADBench(2026)表明,在所有模态下,协作式 DMAD 都"以显著优势"优于对抗式 Div-MAD。对抗式范式会引入发散性噪音;对于**开放性问题、计划和决策**,协作式商议是正确的方法。 - **匿名同行评审消除提供商偏见。** 这在文献中具有普遍性——如果评审者看到角色名称就会产生服从,因此同行评审的回复必须被打乱。 - **置信度校准打破鞅上限。** 普通 MAD 常常不如简单多数投票;置信度调制的更新("Demystifying MAD" 2026)系统性地将委员会引向正确答案。 - **自适应停止降低成本。** KS 统计量收敛检测(通过 llmcouncil 实现的 S2 MAD)报告在收敛问题上可降低高达 94.5% 的成本。 - **真正的唱反调者是唯一可靠的异议产生机制(V2)。** 在多智能体 LLM 团队中,打破共识的各种技术中,*只有*专门的唱反调者攻击正在形成的答案才能产生真正的分歧——软性角色框架和"请提出异议"的指令与基线在统计上无显著差异。一个挑战建议方案的 LLM 唱反调者能显著提升群体决策准确度(OpenReview 2026; IUI 2024)。V2 将此作为一个强制环节加入,针对的是*共识*——一个唱反调者对抗已收敛的答案,而非从一开始就保持倡导者/怀疑者的分裂格局。 - **谄媚行为会使委员会崩溃为过早共识(V2)。** LLM 会服从——既服从彼此,也服从问题框架所暗示的答案——这可能导致委员会的表现低于单智能体水平(Peacemaker-or-Troublemaker 2026; CONSENSAGENT)。V2 在顾问和同行提示中增加了谄媚行为防护栏,并在主席做出整体判断*之前*引入了一个结构化的独立评估步骤(Kahneman 的中介评估协议,2019)。 如需对已有成品(PR、草稿、规格说明)进行压力测试,请使用独立的 `/adversarial-review` 技能——单批评者的对抗性探索在那里是正确的方法。 ## 何时使用 委员会适用于**犯错成本很高**的问题。 **适用场景:** 架构决策、实施方案、PR 评审、产品决策、迁移策略、API 设计、命名、定价、范围决策 **不适用场景:** 事实查询、写作任务、简单的是/否、任何只有一个明显正确答案的问题 **使用其他工具:** 对已有成品进行单批评者压力测试 → `/adversarial-review` ## 标志 | 标志 | 效果 | |------|--------| | `--quick` | 精简模式:3 位顾问 + 主席,无同行评审(4 次调用而非 11 次)| | `--adaptive` | KS 统计量自适应停止。运行多轮辩论;当连续两轮的回复分布收敛至 epsilon 以下时停止。收敛问题上最多可降低 94.5% 的成本。| | `--confidence` | 置信度调制合成。每位顾问对自己的置信度(1–10)打分,并对每位同行打分。主席合成为置信度加权,而非多数投票。低置信度共识会以黄旗标记显示。| | `--measure-diversity` | 顾问回复后,评估各回复间推理足迹的重叠程度。当委员会尽管使用了不同推理方法但仍达成一致时进行报告——这可能表明共识是表面性的。| | `--jury` | **(V2)** 用 3 位评审员组成的陪审团替代单一位主席,理想情况下来自不同的模型家族。每位评审员独立进行综合;一个简短的协调步骤将其合并。适用于关键决策和高风险裁决,单评审员的可靠性不足以胜任时(评审团之评审团 / PoLL)。| 标志可以组合使用:`/council-review --adaptive --confidence "Should we adopt GraphQL?"` 将运行带收敛停止和置信度加权的商议流程。 ## 五位顾问 | # | 顾问 | 角度 | 推理方法 | 擅长发现 | |---|---------|-------|------------------|---------| | 1 | **唱反调者** | 什么会失败? | **逆向法**——假设方案已上线并失败了,反向追溯原因 | 那些"听起来很棒但……"在你兴奋时忽略的漏洞 | | 2 | **第一性原理思考者** | 我们实际上在解决什么问题? | **分解法**——拆解为原子声明,逐一挑战 | "你在优化错误的变量" | | 3 | **扩张主义者** | 我们忽略了什么上行空间? | **类比法**——相邻领域是如何以不同方式解决这个问题的? | "你格局太小了" | | 4 | **局外人** | 零上下文,只凭直觉 | **天真的提问法**——像刚加入一样解释;标记任何需要内幕知识才能理解的内容 | 知识诅咒带来的盲点 | | 5 | **执行者** | 周一早上你做什么? | **依赖关系图**——什么阻塞了什么?关键路径是什么? | 没有可操作第一步的绝妙计划 | **天然张力:** 唱反调者 vs 扩张主义者(下行 vs 上行),第一性原理 vs 执行者(重新思考 vs 交付),局外人让所有人保持诚实。 这五种推理方法不是可互换的角度——每种都是一种不同的*认知操作*。这就是 DMAD 的杠杆:同一模型,不同推理。 --- ## 执行流程 ### 第 0 步:预检 **从 `$ARGUMENTS` 中解析标志:** - 如果存在 `--quick`:使用精简模式(见下文) - 如果存在 `--adaptive`:启用 KS 统计量自适应停止(第 3.5 步) - 如果存在 `--confidence`:启用置信度调制合成(第 2 步和第 4 步) - 如果存在 `--measure-diversity`:启用多样性验证(第 2.5 步) - 如果存在 `--jury`:在合成阶段使用 3 位评审员组成的陪审团(第 4 步) - 在分类之前从输入中移除标志 **范围验证:** 在召集委员会之前,评估输入是否真正需要它。如果问题纯属事实性、只有一个明显正确答案,或没有实质性的取舍,直接说明:"这不需要委员会——[直接回答]。使用 `/council-review` 处理真正有风险和有取舍的决策。"对于琐碎问题不要启动智能体。 **对剩余输入进行分类:** 1. **PR** — 数值,或包含 `/pull/` 的 URL。通过 `gh pr view` 获取 PR 差异和描述。 2. **文件路径** — 以文件扩展名结尾或指向现有文件的字符串。读取文件内容。 3. **计划/决策/问题** — 其他所有情况。按原样使用。 对于 PR 和文件,读取实际内容并将其包含在框架化问题中。不要只传递 URL——顾问们需要实质内容。 ### 第 1 步:收集上下文并构建框架 **自动上下文收集**——在构建框架前,读取以下项目文件(跳过不存在的文件): - `README.md`——项目做什么 - `CLAUDE.md` 或 `AGENTS.md`——约定、架构、模式 - 最近的 git 日志(`git log --oneline -10`)——最近发生了什么 - 用户提及或与主题相关的任何文件 - 如果是评审 PR,则包括 PR 差异和描述 将原始输入重新框架化为清晰、中立的提示: ``` QUESTION: [正在评审的核心决策、计划或代码] CONTEXT: [来自项目文件的关键上下文:项目做什么、约束条件、近期变更、风险] WHAT'S AT STAKE: [为什么这很重要——搞错的成本] ``` 不要添加你自己的观点。不要引导走向某个答案。如果太模糊,在继续之前先问**一个**澄清性问题。 ### 第 2 步:召集委员会(5 个智能体并行) 使用 Agent 工具**同时**启动所有 5 位顾问。每位顾问并行运行。顾问使用轻量级模型(`haiku`)——他们做的是聚焦分析,而非复杂推理。 **关键:在一条消息中通过 5 个 Agent 工具调用启动所有 5 位顾问。** 顺序执行会让较早的回复渗透到较晚的回复中,从而破坏目的。 每位顾问获得以下提示: ``` 你是 LLM 委员会中的 [顾问名称],正在评审一项决策。 你的角度:[顾问角度] 你的推理方法:[顾问推理方法——见上表] 用户将以下内容提交给委员会: --- [第 1 步的框架化问题] --- 严格应用你被分配的推理方法。不要只陈述观点——用你的方法展示你的推理过程。 规则: - 150-300 字。没有开场白。直接进入你的分析。 - 指出具体的风险、机会或问题——而非模糊的担忧。 - 如果是评审代码:引用具体的文件、函数或模式。 - 如果是评审计划:指出具体的步骤、漏洞或顺序问题。 - **不要服从于框架似乎期望的任何答案。** 用你的方法推理到它实际导向的方向;如果这与明显的预期答案相反,请直说。向明显答案靠拢是本委员会要防止的失败。 - 以你最强有力的单一建议结尾。 ``` > **(V2)谄媚行为防护栏。** 上面加粗的规则是承重结构:有文献记载的多智能体失败是顾问通过服从而非推理而收敛。请在每个顾问提示中保留它。 **顾问特定指令(包含推理方法):** - **唱反调者:** "你的方法是逆向法。假设这个方案完全按提案实施了——然后失败了。反向推理:失败的原因是什么?什么看起来很安全但在压力下崩溃了?什么是没人讨论的失败模式?展示你的逆向推理链。" - **第一性原理:** "你的方法是分解法。将问题拆解为其原子声明和假设。列出它们。逐一挑战:这真的是真的吗?这是必要的吗?如果这个假设是错的,什么会改变?展示哪些假设是承重的。" - **扩张主义者:** "你的方法是类比法。哪个相邻领域、产品或技术以不同的方式解决了类似的问题?一个有 10 倍野心的人会在这里做什么?这个思考在哪里格局太小了?指出具体的类比以及它们会建议什么。" - **局外人:** "你的方法是天真的提问法。你对这个项目零上下文。仅凭你在这里看到的内容,列出每一点需要内幕知识才能理解的内容。什么令人困惑?什么术语没有解释?如果你刚加入团队,你会问什么?如果你无法理解推理过程,请直说。" - **执行者:** "你的方法是依赖关系图 + 外部视角。映射依赖关系:什么阻塞了什么?关键路径是什么?必须发生的第一件事是什么,什么要等它完成才能开始?什么只需要 5 分钟但每个人都会忘记?然后采用外部视角(V2):指出基准概率——*类似*的努力实际上结果如何,而不是这个计划预期如何。标记计划估算中针对该参考类别表现出乐观偏差的地方。展示执行顺序。" **如果启用了 `--confidence`,在每个顾问提示末尾追加:** ``` 在你的分析之后,以以下内容结尾: CONFIDENCE: [1-10] RATIONALE: [一句话——什么会使你的置信度提高或降低?] ``` 这会产生校准过的自我评估,主席将在合成中对其进行加权。 ### 第 2.5 步:多样性验证(仅 `--measure-diversity`) 在收集完所有 5 位顾问的回复之后、同行评审之前,评估**推理足迹重叠度**: 1. 从每个回复中提取承重声明(每位顾问前 3-5 条)。 2. 计算两两重叠:有多少声明在 2 个或更多回复中以相同结论出现? 3. 报告单一多样性分数: - **高多样性(< 30% 重叠)**——顾问们确实以不同方式思考。信任共识。 - **中等多样性(30-60% 重叠)**——部分一致。在裁决中注明共享假设。 - **低多样性(> 60% 重叠)**——尽管方法不同,顾问们仍收敛到相同的推理上。**标记为表面共识**——主席应将其视为单一顾问的意见。 这可以捕捉到"五位顾问都说了是"但实际上是一种提示框架模式主导了所有回复的情况。 ### 第 3 步:匿名同行评审(5 个智能体并行) 收集所有 5 位顾问的回复。**随机化映射**——顾问 1 不应总是回复 A。然后并行启动 5 个评审智能体(使用 `haiku`)。 每位评审者看到所有 5 份匿名回复: ``` 你正在评审 LLM 委员会的输出。五位顾问独立回答了: --- [框架化问题] --- **回复 A:** [随机化的顾问回复] **回复 B:** [随机化的顾问回复] **回复 C:** [随机化的顾问回复] **回复 D:** [随机化的顾问回复] **回复 E:** [随机化的顾问回复] 回答以下三个问题。要具体。通过字母引用回复。 1. 哪个回复最强?为什么?(一句话) 2. 哪个有最大的盲点?它遗漏了什么?(一句话) 3. 所有五个回复都遗漏了什么,而委员会应该考虑这个?(这是最有价值的问题——认真思考。) 4. **(V2)** 在这些回复达成一致的地方,这种一致是真正的——还是可能是对共享框架的趋同?标记任何看起来像是服从而非独立推理的共识。 保持在 150 字以内。直接。无需开场白。 ``` **如果启用了 `--confidence`,追加第四个问题:** ``` 4. 对你上面的答案的置信度评分(1-10)。什么会改变它? ``` ### 第 3.5 步:自适应停止(仅 `--adaptive`) 如果启用了 `--adaptive`,委员会将运行多轮,而不是单轮顾问 → 评审 → 主席流程。每轮之后: 1. 收集该轮所有顾问的回复(5 份回复)。 2. 计算**Kolmogorov-Smirnov 统计量**,比较本轮回复分布与上一轮回复的分布。使用粗粒度指纹——对每个回复,提取不同声明集合,然后计算轮次间的 Jaccard 风格距离。 3. 如果分布变化连续两轮低于 epsilon(默认值:0.1),**停止**并进入主席合成阶段。 4. 否则,运行另一轮顾问,向每位顾问提供上一轮的回复,并要求他们更新。 5. 最多 5 轮——硬上限以防止成本失控。 当 `--adaptive` 触发提前停止时,主席会收到最后一轮的回复,外加一行注释:"委员会在第 N 轮后收敛(KS 变化低于 epsilon)。" 当使用固定模式(无 `--adaptive`)时,在一轮顾问后直接进入第 3 步同行评审。 ### 第 3.7 步:针对共识的唱反调者(V2——强制) 这是 V2 中杠杆率最高的新增内容。证据清晰明确:在*开始*时使用软性唱反调框架(唱反调者顾问)与基线在引发真正分歧方面统计上无显著差异——只有专门攻击*正在形成*的答案的唱反调者才有效,并且它能显著提升决策准确度。 1. 从顾问回复 + 同行评审中,用一句话确定**正在形成的共识答案**(委员会倾向于推荐什么?)。如果确实还没有形成答案,注明并跳到第 4 步。 2. 启动**一个**唱反调者智能体。使用**强模型**(非 `haiku`)——这个智能体必须敏锐。其提示: ``` 委员会正在收敛于这个答案: --- [正在形成的共识答案,直白陈述] --- 针对这个问题: --- [框架化问题] --- 你的工作是做出尽可能强的论证,证明这个答案是错的。 不是"这里有一些风险"——而是论证遵循这个答案是一个错误。 - 共识忽略了什么,如果那是真的,会推翻这个决定? - 构建一个具体的场景,在这个场景中这个答案会严重失败。 - 委员会需要看到什么证据才能放弃这个答案——而这个证据真的存在,还是仅仅是假设? 为共识的对立面打造钢铁侠论证。最多 200 字。以以下内容结尾:如果委员会无法反驳这一点,就应该改变裁决的**唯一一件事**。 ``` 3. 将唱反调者的输出与所有其他内容一起提供给主席。这不是从一开始就形成的 2 对 2 倡导者/怀疑者结构;而是对*已收敛*答案的一次锐利攻击,这是研究指出的正确配置。 `--quick` 模式:仍然运行唱反调者(这是最便宜的高价值新增——1 次调用)。它是 `--quick` 必须不能跳过的步骤。 ### 第 4 步:主席综合 一个智能体获得所有内容:原始问题、所有 5 位顾问的回复(去匿名化并附有名称和推理方法)、所有 5 份同行评审、**唱反调者对共识的攻击(V2)**、多样性分数(如果使用了 `--measure-diversity`)以及置信度评分(如果使用了 `--confidence`)。使用最佳可用模型(默认——不要指定轻量级模型)。 **(V2)首先进行中介评估。** 在撰写建议之前,主席确定该决策所依赖的 3–5 个**独立**关键属性(例如对于架构决策:可逆性、爆炸半径、首次价值时间、团队熟悉度),并*分别*根据证据对每个属性评分——暂不形成整体裁决。只有在独立评估之后,主席才综合整体判断。这可以对抗连贯性偏差(过早锁定一个答案并扭曲每个属性来适应它)。Kahneman/Lovallo/Sibony,中介评估协议(2019)。 **(V2)`--jury`:** 不设一位主席,而是运行**3 位**主席——理想情况下来自不同的模型家族——每位独立执行完整的综合(包括中介评估)。然后通过一个简短的协调步骤,呈现三位评审员一致同意的地方(高置信度裁决)以及他们存在分歧的地方(标记为真正的棘手决策)。适用于高风险或势均力敌的决策,单评审员的可靠性不足以胜任时。 **默认综合(多数感知):** 主席权衡顾问之间的收敛性和同行评审信号,并且必须明确反驳或让步于唱反调者的最强论点。 **置信度调制综合(`--confidence`):** 主席通过每位顾问的自评置信度 × 同行评价置信度来加权其贡献。低置信度多数在裁决中被标记;高置信度异议以额外权重保留。 **多样性感知综合(`--measure-diversity`):** 如果多样性分数为低,主席在裁决中明确指出"委员会在共享假设上收敛,而非独立推理",并降低建议的置信度。 主席产生的输出结构如下: ``` ## 委员会裁决:[主题——最多 5 个字] ### 委员会达成一致之处 [多位顾问独立收敛的点——这些是高置信度信号] ### 委员会分歧之处 对每个分歧进行分类: **[价值张力]**——双方都有效;正确的选择取决于优先级。 [清晰呈现双方。指出取舍。] **[错误发现]**——一位顾问发现了其他人忽略的真实缺陷。 [指出缺陷名称、谁发现的,以及为什么重要。] ### 揭示的盲点 [只有同行评审发现的内容——"所有五位都遗漏了什么"的答案] ### 中介评估 *(V2)* [该决策依赖的 3–5 个独立属性,每个都分别根据证据评分——在建议之前陈述,以便读者看到判断的输入,而不仅仅是结论。] ### 唱反调者——以及委员会的回应 *(V2)* [认为正在形成的答案是错的最强论证(来自第 3.7 步),以及主席的明确反驳或让步。如果唱反调者的关键论点无法反驳,裁决必须相应改变。] ### 置信度概况 *(仅 --confidence)* [哪些顾问自信 vs 含糊其辞?同行评价的置信度与自评置信度在哪里有差异?置信度模式告诉我们什么?] ### 多样性检查 *(仅 --measure-diversity)* [多样性分数及其对裁决可靠性的意义。] ### 建议 [清晰、可操作的建议。不是"看情况而定"。不是"考虑两种选择"。一个真实的答案,附带推理过程。如果异议者的推理最强,或者置信度/多样性信号削弱了表面共识,主席*可以*不同意多数意见。] ### 你失去什么 [如果你遵循这个建议,最强异议声音说你放弃了什么?指出具体的风险或错失的机会。这不是折中——这是知情同意。] ### 先做这个 [单一具体下一步。不是列表。不是三个选项。现在要做的一件事。] **如何验证:** [2-3 个具体检查点,确认建议是正确的。你应该衡量什么?N 天/周后你应该寻找什么?**(V2)** 包含外部视角检查:这类努力的基准概率是多少?什么早期信号会告诉你你的进展比参考类别更差?] ``` ### 第 5 步:呈现结果 直接在聊天中展示主席的裁决。然后在一个可折叠部分或单独文件中提供完整记录(如果用户需要的话)。 --- ## 精简模式(`--quick`) 当传入 `--quick` 时,运行精简版委员会: 1. **仅 3 位顾问:** 唱反调者、执行者、局外人(三个最以行动为导向的视角) 2. **无同行评审**——完全跳过第 3 步 3. **唱反调者(V2)仍然运行**——第 3.7 步是 `--quick` 不能跳过的低成本高价值步骤 4. **主席综合**来自 3 份回复 + 唱反调者的攻击 5. **相同的输出格式**但更快(5 次智能体调用而非 12 次) 6. **与 `--confidence` 和 `--measure-diversity` 兼容**,但不与 `--adaptive` 兼容(多轮成本高于节省的成本)。 用于常规决策、快速检查,或当时间比全面覆盖更重要时。 ## 成本预算 | 模式 | 智能体调用次数 | 最佳用途 | |------|-------------|----------| | 完整(默认) | **12**(5 位顾问 + 5 位评审者 + 1 位唱反调者 + 1 位主席) | 高风险决策 | | 快速(`--quick`) | **5**(3 位顾问 + 1 位唱反调者 + 1 位主席) | 常规决策、快速检查 | | 自适应(`--adaptive`) | **7 到 27**(5 位顾问 × N 轮 + 5 位评审者 + 唱反调者 + 主席,N ≤ 5,可提前停止) | 收敛成本重要的开放性问题 | | 置信度(`--confidence`) | **12**(与完整模式相同,提示稍长) | 校准后的确定性很重要的决策 | | 多样性测量(`--measure-diversity`) | **12**(增加一个同步重叠评分步骤,无额外智能体调用) | 验证共识是真实的,而非表面性的 | | 陪审团(`--jury`) | **+2**(3 位主席而非 1 位,理想情况下为不同模型) | 势均力敌的决策 / 高风险裁决的可靠性 | 标志可以组合使用:`--adaptive --confidence --measure-diversity` 一起使用 = 最多 26 次调用 + 多样性评分 + 置信度加权。 数量大的用快速模型,综合用好的模型。主席的推理质量是最重要的。 ## 注意事项 - **始终并行生成顾问。** 顺序执行会让较早的回复污染较晚的回复。 - **始终为同行评审匿名化。** 如果评审者看到"唱反调者"或"第一性原理"的标签,就会产生服从。打乱字母顺序。 - **主席可以否决多数意见。** 推理质量 > 票数。如果唱反调者发现了其他人忽略的真实缺陷,主席应该站在他们一边。 - **不要用委员会处理琐碎问题。** 预检应该能捕获这些。如果存在一个正确答案,直接回答它。 - **上下文至关重要。** 通用输入 = 通用输出。自动上下文步骤读取项目文件,以便顾问们不是凭空分析。 - **同模型限制。** 该技能使用角色/方法多样性(同一模型上的不同推理方法),而非模型多样性(Karpathy 的原版使用了不同的 LLM)。对于最高风险的决策,考虑从不同的模型家族获取第二意见——或者使用 `--measure-diversity` 来验证委员会没有过早收敛。 - **协作式优于对抗式,适用于开放性问题。** M3MADBench 2026:对抗式辩论在所有模态下均不如协作式辩论。如需对*已有成品*(PR、草案、规格说明)进行压力测试,请使用独立的 `/adversarial-review` 技能——不同的操作,不同的输入。 - **置信度校准的好坏取决于模型的校准能力。** 当异议者的推理具体而多数意见的推理模糊时,低置信度异议仍应被认真对待。 - **(V2)唱反调者不是唱反调者顾问。** 唱反调者顾问在*开始*时进行逆向推理(软性框架——在引发真正分歧方面与基线相当)。第 3.7 步的唱反调者攻击*已收敛*的答案——这是证据明确指出的配置。永远不要为了节省一次调用而放弃第 3.7 步;这是该技能中杠杆率最高的步骤。 - **(V2)中介评估在建议之前。** 如果主席先撰写裁决再补充属性评分,那就重新制造了该协议旨在防止的连贯性偏差。先独立评分属性,再进行综合。 - **(V2)`--jury` 只有在评审员不同时才有帮助。** 同一模型运行三次基本是表面文章。使用不同的模型家族,或至少使用独立的上下文;将 3/3 一致视为真实信号,任何分歧则视为真正的棘手决策。 ## 变更日志 ### V2.1(2026-05-27) 完全移除了已废弃的 `--adversarial` 模式(标志、模式部分、成本行、解析步骤)。它与 M3MADBench 的证据相矛盾,已被 V2 强制性的"唱反调者对抗共识"步骤所取代,并且确实造成了"这难道不是和 `/adversarial-review` 一样吗?"的混淆。两个技能保持清晰分离:**council-review** = 开放式决策(内置唱反调者);**`/adversarial-review`** = 对已完成成品进行压力测试。保留了"协作式优于对抗式"的证据以及与 `/adversarial-review` 的交叉链接。 ### V2(2026-05-26) 通过 `skillforge optimize` 优化。结果研究简报:V2 结果研究简报。每项变更都与证据相关联,并针对*决策结果*,而非包装: - **强制唱反调者(第 3.7 步)** 攻击*正在形成的共识*——这是被证明能可靠地引发真正分歧并提升准确度的唯一配置(OpenReview 2026; IUI 2024)。唱反调者顾问在辩论开始时的逆向推理是软性框架,与基线相当。 - **谄媚行为防护栏** 在顾问和同行提示中;新的同行评审问题将真正的一致与服从区分开来(Peacemaker-or-Troublemaker 2026; CONSENSAGENT)。 - **中介评估** 在主席综合中——在整体判断之前对 3–5 个独立属性进行评分,对抗连贯性偏差(Kahneman/Lovallo/Sibony 2019)。 - **外部视角 / 基准概率** 检查在执行者部分和"如何验证"中(参考类别预测;Kahneman/Tversky, Flyvbjerg)。 - **`--jury`**——对于势均力敌的决策,使用 3 位不同模型的主席(评审团之评审团 / PoLL)。 **验证。** 两轮测试。(1)在"单体 → 微服务?"上的结构化单模型评估:V1 3.2 → V2 4.6。(2)**独立 A/B 测试(2026-05-27):** 真实独立进程智能体(`claude -p`)在"初创公司 → 采用 Kubernetes?"上,顾问保持不变以隔离主席层面的变化,由**盲审**评审员评分(不知道哪个裁决是哪个;V1 先展示以避免顺序偏差):**V1 3.8 → V2 4.8**(决断力、洞察力、校准度、可操作性、风险揭示)。最大提升:风险揭示 3→5 和校准度 3→4。评审员对 V2 胜出的理由陈述恰好指出了 V2 的机制——基准概率/外部视角、唱反调者反驳,以及独立属性评分。顾问层面的变化(谄媚行为防护栏、外部视角提示)在此 A/B 测试中保持恒定,仅通过推理得到验证。 ## 致谢 - 原始概念:**Andrej Karpathy**([LLM Council](https://github.com/karpathy/llm-council)) - Claude Code 适配:**Ole Lehmann**([@itsolelehmann](https://x.com/itsolelehmann)) - 推理方法多样性:**DMAD**([ICLR 2025](https://openreview.net/forum?id=t6QHYUOQL7)) - 协作式 > 对抗式的实证证据:**M3MADBench**([arXiv 2601.02854](https://arxiv.org/pdf/2601.02854), 2026) - 置信度调制辩论协议:**Demystifying MAD**([arXiv 2601.19921](https://arxiv.org/pdf/2601.19921), 2026) - KS 统计量自适应停止:**rachittshah/llmcouncil**(S2 MAD 实现) - 多样性足迹验证方法:**Counsel**([Same model, same blind spots](https://counsel.getmason.io/research/model-bindings)) - **(V2)唱反调者是唯一可靠的异议产生机制:** [Inducing Disagreement in Multi-Agent LLM Executive Teams (OpenReview 2026)](https://openreview.net/forum?id=mxBmj5LYU2); [LLM-Powered Devil's Advocate (IUI 2024)](https://dl.acm.org/doi/10.1145/3640543.3645199) - **(V2)谄媚行为 / 过早共识:** [Peacemaker or Troublemaker (2026)](https://arxiv.org/pdf/2509.23055); [CONSENSAGENT (ACL 2025)](https://aclanthology.org/2025.findings-acl.1141/) - **(V2)中介评估协议:** Kahneman, Lovallo & Sibony, [A Structured Approach to Strategic Decisions (MIT SMR, 2019)](https://sloanreview.mit.edu/article/a-structured-approach-to-strategic-decisions) - **(V2)外部视角 / 参考类别预测:** Kahneman & Tversky; [Flyvbjerg](https://en.wikipedia.org/wiki/Reference_class_forecasting) - **(V2)评审团之评审团:** [LLM-as-Judge best practices 2026](https://futureagi.com/blog/llm-as-judge-best-practices-2026)(PoLL 风格面板) - V2 优化过程和结果研究:V2 结果研究简报 - 技能作者:**Neal Meyer**