跳到主要内容

多智能体生产化设计的 7 条铁律:从 agency-agents 学到的生产纪律

把 5 个 Agent 串成一个链,Demo 跑通了,人人都觉得"这就叫多智能体"。直到生产环境里 Agent B 超时、Agent C 返回了一堆垃圾、下游把垃圾当真——才发现架构里全是默认"一切正常"的假设。msitarzewski/agency-agents(MIT)里那位 "Multi-Agent Systems Architect" 角色,把分布式系统的纪律写进了 Agent 工程:失败模式、最小权限、回退链、上下文预算、评测门禁。本文把它提炼成 7 条可以直接照做的铁律。

铁律 1:Demo 会骗人,生产才说真话​

"It worked when I ran it" is not a design.

写代码前先枚举失败模式:每个 Agent 会超时吗?会返回结构错乱的结果吗?会与邻居矛盾吗?每条失败都要有明确的恢复路径,而不是祈祷 happy path。

铁律 2:最小权限,永远​

每个 Agent 只拿它完成任务所需的最小工具和数据。Token/凭证绝不在 Agent 之间传递——需要凭据时由编排层按角色注入,而不是让 Agent 互相转交"顺手带上"的 key。

铁律 3:每个 Agent 都要有回退链​

主路径 → 窄化回退 → 降级/规则兜底 → 升级到人。系统在任何时刻都必须"能产出点什么":结构化的降级响应,好过静默失败。客户宁可看到"该服务暂不可用,已通知人工",也不想要一份看着正常其实是编造的报告。

铁律 4:绝不静默截断上下文​

上下文预算不够时,停住并上报,而不是悄悄把关键字段丢进压缩里。静默截断是生产事故的第一大来源——Agent 缺失了约束条件,就会自信地给出错误答案。

铁律 5:可观测性不可谈判​

每个 Agent 调用发出结构化日志,共享同一个 trace_id。回答错了,你要能一路追到是哪个 Agent 在哪个环节引入的错。没有这条,多智能体系统就是一个"无人认领错误"的黑盒。

铁律 6:默认层级拓扑,而不是 mesh​

网状(mesh)拓扑复杂度最高、最难调试。默认选层级式(orchestrator-subagent),除非你能明确论证 mesh 的必要性,并且给它配好仲裁者和终止条件。生产级多智能体系统的第一原则是"可调试",不是"优雅"。

铁律 7:没有评测,不许部署​

新模型/新 Agent 上线前必须过评测门:≥20 个案例的评测集、记录的基线、达到或超过基线的分数、全链路回归。数据说话,直觉闭嘴。


FDE 落地清单​

把 7 条铁律翻译成 FDE 交付客户时的检查项:

铁律交付检查项
1 失败模式给客户讲架构时先讲"每步坏了怎么办",而不是只讲 happy path
2 最小权限交付文档中列出每个 Agent 的工具清单 + 权限边界
3 回退链每个 Agent 都配置降级响应模板
4 不静默截断上下文预算写进系统提示;超预算时 halt-and-escalate
5 可观测性trace_id 贯穿;给客户看"错误溯源演示"
6 层级拓扑默认 orchestrator-subagent,mesh 需书面论证
7 评测门禁上线报告附评测集规模、基线、通过率

与本站其他内容的关系​

  • 这条纪律和 fde-skills 是同一生态的两面:fde-skills 让交付物会记住经验,agency-agents 让 Agent 系统守得住生产纪律(见《fde-skills:让 FDE 交付物会记住经验的开源技能包》)
  • 更系统化的训练请走本站「Agentic AI」系统学习:L1-L5 的 Harness、上下文、安全护栏、评估可观测性,正是这些铁律的完整展开