当输出越来越自主,监督成了新瓶颈
Andrej Karpathy 在 10 月 3 日聊到一个被忽视的问题:模型干越来越多的自主活,人类怎么读懂它在干什么?长文输出读不过来,纯文本也难快速判断「它做对没有、哪里偏了」。他的建议不是换更强的模型,而是换一种「给人看」的格式。
四类可读格式
思路是让产出本身变得可监督:用 ASD-STE100 这类受控自然语言写操作说明,让指令简明无歧义;该要图就生成图,用 diagram 表达结构;把结果做成交互式 HTML 页面,人能直接点开看;甚至生成定制讲解视频,把复杂过程讲给人听。格式不是装饰,而是把「模型在想什么」摊开给人审。
范式从「写」移到「审」
这套做法的隐含转向是:把人的力气从「自己写」挪到「审与懂」。模型可以批量产出大量可丢弃、可审计的大件制品——一个页面、一段讲解、一张图——人只需在关键处纠偏,而不是从零生成。对越来越自主的 agent 而言,这其实是把监督成本前置到格式设计上。
对落地的启示
可解释性和人类监督接口,常常被当成「锦上添花」,但在 agent 规模化部署里,它们更接近隐性基础设施:没有让人快速看懂并介入的通道,自主度越高,失控风险越难兜住。把输出做成可监督的格式,本质上是给自主性配了一道人机之间的安全阀。
落到工程上意味着什么
对做 agent 产品的团队,这提示一个常被忽略的投入:输出格式本身就是产品。与其让用户读一长串文本,不如默认产出可交互、可图、可讲解的产物,并把「人何时介入」设计进格式里。监督接口做得好,自主度才敢往上加;否则加得越多,越没人看得住。
可读格式不是银弹
也要泼盆冷水:把输出做得好看,不等于把推理变得可信。一张干净的图、一段顺滑的讲解视频,可能只是把错误包装得更体面——格式解决的是「人能不能快速看」,不解决「模型到底对不对」。更务实的落地,是把可读制品和真正的可审计痕迹绑在一起:谁触发、走了哪些工具、改了哪些文件,这些结构化日志不该被漂亮的输出替代。格式是监督的入口,不是问责的终点。