多智能体系统聚在一起过日子,迟早要面对一个绕不开的问题:规矩谁定?主流做法有三种,要么实验员直接把规则写死,要么在提示词里劝两句「请大家合作」,要么从一排预设机制里挑一个套上。arXiv 2609.22600 的作者 Gregory Rehm 觉得这三种都不算真治理,于是给了智能体一样此前少有的东西:立法权。这篇题为「从注定的毁灭到幸存:LLM 智能体社会中的智能体驱动自治」的论文,把治理变成了智能体自己动手写的可执行代码。
实验搭在公共池塘资源环境 GovSim 上,扩展版叫 GovSim-SelfGovern。规则变了:智能体可以自己起草 Python 治理法案,先送进沙箱试跑、拿到验证反馈,再提交全体投票,通过后生效,所有人——包括投反对票的——都生活在自己参与立下的规矩里,一轮一轮过下去。法案是真代码,不是修辞:写「每人每轮收割上限三单位」,下一轮系统就真的按三单位卡。
考题设了三档。资源稳定丰裕时,日子好过,制度可以慢慢试错;压力上来,制度开始退化,智能体得赶在社区散架之前把漏洞补上;最狠的一档是「致命资源墙」——五个智能体光靠收割谁也活不下来,必须及时写出管用的法律,才有可能集体渡过难关。结果给出一个冷峻的结论:可执行治理确实扩大了智能体的干预空间,但活不活得下来,取决于它们能不能在时间窗口关闭前发明出对的制度。制度写得慢、写得烂,照样死。
有两处发现值得单独说。一是财政能力:能收税、有公共储备的社会,才玩得动再分配——穷政府救不了灾,这条人类政治经济学的基本常识,在智能体社会里原样复现。二是放逐机制的可行性:更深的推理能力和取消民主否决,都会让「把害群之马开除出去」变得更容易执行。这直接牵出一个对齐研究的核心问题——当智能体迟迟不提出放逐时,究竟是它在价值层面否决了这种惩罚,还是压根没想到这个选项?作者把这个区分摆上了台面:规范判断与认知盲区,在观察者眼里长着一模一样的脸,处方却完全不同。
把这篇论文放进近期的智能体社会研究谱系,位置就清楚了。此前覆盖过的几条线各有分工:Emergence World 做的是对抗性压测,证明检测失控不等于遏制失控;社会约束类研究回答的是「给定规则下群体怎么表现」;而 GovSim-SelfGovern 把问题往前推了一步——规则本身从哪来。稀缺一加进来,制度设计就从工程题变成了政治题与伦理题:谁有立法权、少数派服不服、惩罚的边界在哪,全是智能体和它的设计者要一起回答的问题。
工程侧的呼应也值得一提。企业级智能体平台这两年都在往「策略即代码」上收敛——权限边界写成运行时校验、合规规则做成可执行检查,与本篇论文里「法案是真代码」的思路同源。差别在方向:企业平台是人替智能体写代码,GovSim-SelfGovern 是智能体自己写、自己投、自己改。两条线若合流,场景不难想象:生产环境里的多智能体系统在受控沙箱里起草局部工作流规则,人类审批后生效,系统随负载变化自动修订——治理从静态配置变成动态制度。前提当然是可验证性:智能体写的代码先要能被证明无害,这正是沙箱验证环节存在的意义。
对做多智能体系统的人来说,这篇论文最实用的提醒可能很朴素:与其替智能体把规矩定死,不如给它们一套「写规矩、试规矩、改规矩」的基建——沙箱验证加上投票表决,就是智能体世界的立法程序。当然,单作者论文、单一环境、结论是否跨任务泛化,还有待更多复现;论文代码与实验细节的开放程度,目前官方渠道暂未披露更多细节,后续将持续跟进迭代动态。但方向值得记下:当智能体开始拥有立法权,对齐研究的对象就从「模型听不听话」变成了「制度怎么生长」。