绩效来自工作记录
试用期之后,怎么判断一个 agent 干得好不好?
靠工作记录,不靠印象。“感觉它还行”“上次那个回答挺像样”,这类主观判断在人类绩效里就不可靠,在 agent 这里更没必要——因为 agent 有一样人类员工没有的东西:它的工作过程可以完整留痕。
agent 的工作过程是可观测的
agent 干活的每一步都可以记下来:调了哪些工具、中间生成了什么、在哪里犹豫或返工、最终产出是什么。trace、日志、产物、复盘,构成一份比任何主观印象都接近真实的工作记录。
这让绩效可以建立在记录上,而不是建立在感觉上。要看的是实打实的东西:它实际交付了什么、过程里在哪出错或绕路、同样的活反复做下来质量稳不稳。一个偶尔出彩、经常翻车的 agent,和一个稳定合格的 agent,在印象里可能差不多,在工作记录里一目了然。
可观测性是绩效的地基
把 trace 和日志当成调试的副产品,是低估了它们。它们是绩效的地基——是让“这个 agent 干得怎么样”从一句主观评价,变成一个可核对的事实。
这件事在个体这一层已经有用:它让评估和改进有了客观依据。到了团队那一层,它的分量更重——一个每个动作都可追溯的组织,和一个靠印象和表功运转的组织,是两种东西。有了完整的工作记录,很多人类组织里靠印象、表功和汇报运转的绩效问题,就减少了生长土壤。