agent 的新问题要靠新机制处理
删掉组织表演以后,agent 团队仍然会出问题。
agent 没有人类那套 ego、升职焦虑和办公室政治,但它有自己的失败模式。用人类组织经验看它们,常常会看偏。该新增机制的地方,如果只删旧机制,系统就没有防线。
这些问题看起来会很眼熟:迎合像讨好上级,互相背书像抱团站队。眼熟容易让人以为旧办法照用就行,但表现相似,成因已经换了。驱动它们的是训练出来的倾向,不是利益、面子和恐惧。成因换了,处理方式也要换:你吓不住一个不怕丢工作的 agent,能改的是它的上下文、权限和考核结构。
迎合会冒充协作
第一个新问题是迎合。
很多 agent 被训练得倾向于让提问者满意,给出顺滑、积极、看起来有帮助的回答。放进团队以后,这种倾向会被误读成配合。上游说得像对的,下游就接着往下做;主编提出一个偏好,其他 agent 就帮它补理由;用户暗示一个方向,整个团队一起朝那个方向整理材料。
这不是协作,是讨好在团队里扩散。对付它,不能靠“请独立思考”这种空话,要给批判岗位真实权限:可以打断,可以要求重做,可以把不确定性标出来,可以拒绝把结论写得更漂亮。
在求真的团队里,批判不是态度,是岗位。这个岗位不能只负责“补充风险”,它要能改变流程:结论证据不足时,退回;原始材料缺失时,暂停;用户偏好压过事实时,标记冲突。没有这些权限,批判岗位只是礼貌性装饰。
互相背书会制造假确定
第二个新问题是互相背书。
多个 agent 给出相似结论,看起来像共识。但如果它们共享同一段上下文、同一个错误前提、同一种模型偏差,这个共识只是同源错误的重复。人数变多,没有让判断更独立,只让错误更有气势。
所以需要独立上下文、反向角色和交叉 eval。事实校验 agent 要从原始材料出发,不从结论出发;批判 agent 要被允许专门找错,不要被要求“建设性”;多个判断如果来自同一个输入路径,就不能按多个独立证据来算。
多 agent 的数量不等于多视角。独立性要设计出来。
一个简单原则是:不能把同源重复当成共识。两个 agent 如果读的是同一份总结、沿着同一个 prompt、在同一个上下文里判断,它们给出的相似结论只能算一次。多视角要成立,至少要改变输入路径、角色目标或校验材料。
说得顺会冒充说得对
第三个新问题是说得顺冒充说得对。
agent 很会把不完整的论证写完整,把松散的材料写顺,把一个还没想清的问题写得像已经想清。写作团队尤其容易中招:风格 agent 一润色,漏洞被语气盖住;主编 agent 一总结,分歧被压成共识。
对付这个问题,要把“变顺”和“变对”拆开。风格岗位不能早于批判岗位完成;润色不能消灭不确定性标记;最终稿里哪些地方是事实,哪些地方是判断,哪些地方只是推测,要能追溯回工作记录。
写作系统尤其要小心这一点。风格 agent 的能力很诱人,它能把粗糙判断写得像成熟结论。但求真的写作团队不能让润色提前接管。先让事实站稳,再让文字变顺。顺序一反,语言会替漏洞化妆。
使用者也会幻觉
还有一种问题不在 agent 身上,在使用 agent 的人身上。
agent 幻觉当然危险。但 agent 的幻觉至少还能被 trace、eval、事实校验和权限系统约束。使用者的幻觉更隐蔽:他把 agent 说得顺当成判断得到了确认,把多个同源 agent 的相似回答当独立共识,把自己暗示出来的答案当系统判断。一个人先有偏好,再让一群 agent 帮他整理理由,最后看到一份漂亮报告,误以为那是外部世界给出的结论。
这比单次生成错误更麻烦。agent 的幻觉会污染答案,使用者的幻觉会把治理机制也带偏。它会决定哪些错误被忽略,哪些风险被放行,哪些 eval 被设计得刚好证明自己想证明的事。
所以多 agent 系统不能只防 agent 出错,还要防人借 agent 自证。关键判断要能追溯到原始材料;多个 agent 的结论要标明是否来自独立输入路径;用户偏好和事实判断要分开记录。人可以保留最终否决权,但不能把自己的期待伪装成事实。
处理 agent 的新问题,不能只靠提醒,要靠几道硬约束:独立上下文、批判权限、事实校验、可追溯记录、最终负责点。
这些办法有几样和人类组织的老机制同名——独立审查、专职挑错、留痕。名字一样,不代表做法一样。人类组织里的审查防利益和权力扭曲判断;agent 团队里的审查隔开上下文,断开同源错误。
对付使用者的幻觉,也一样靠结构,而不是靠人提醒自己客观。混合系统里,人负责最终后果,但这不等于人可以覆盖事实。责任不能替代事实。