瓶颈不在算力,在工程师的日历

Meta 的广告排序团队刚刚把一个反直觉的结论写成了论文:拖慢这套几十个模型组成的大系统前进的,既不是模型容量也不是训练算力,而是人工 ML 迭代的吞吐量——一次从假设、改代码、训练、调试到评估的完整探索,一位资深工程师在一个模型上要耗掉数天到数周。几十个异构模型排成组合,技术扩散慢且不均匀,长尾的模型几乎没有专家愿意看。arXiv 2609.08248,39 位作者,9 月 8 日提交,描述了他们给出的解法:A-MLE,一个接管整个迭代循环的自主智能体系统。

架构上,A-MLE 用单个智能体编排五个阶段:假设生成、探索策略、实验执行、结果分析与共享知识底座。智能体调用领域技能库与智能体工作流,跑在沙箱执行层之上,训练与评估管线以结构化接口开放给它。设计里最值得琢磨的是人的位置——每个阶段边界都设了人工检查点,智能体干活,工程师在关卡上签字,而不是时刻盯着每次操作。

A-MLE 五阶段流水线:智能体干活,人在每个阶段边界签字假设生成读知识底座探索策略选模型选方向实验执行沙箱内跑训练结果分析显著性判定知识底座沉淀可复用经验人工检查点:方案过审人工检查点:结论把关底层支撑:领域技能库 + 沙箱执行层 + 结构化的训练与评估管线接口单智能体编排全部五阶段;论文另一个结论是 harness 与技能库的可靠性支配整体表现,而不是裸模型能力——L1 能力测试里领域装备版 68%,通用 LLM 只有 8%
图 1|智能体跑完整迭代循环,人类退到阶段边界的检查点上;技能库与沙箱是可靠性来源。

三层能力测试:装备与智商的分账

评估沿三层能力框架展开。L1 工具可用性层,在实验排序模型 M* 上的对比相当直白:领域装备的 A-MLE 配置拿到 68%,通用 ML 智能体只有 16%,裸的通用大模型 8%。差距最大的题型是作业配置修改,领域装备版全部答对,通用配置不到四成。结论写得很克制:在这一层,领域技能而不是模型智力决定成败。

L3 开放式探索层的结果更接近业务价值。在实验排序模型上,多源探索配置——同时组合架构假设与训练效率分析两类生成器——带来 2.56% 的相对离线回归误差改善,而训练吞吐基本不变(QPS 变化 +0.42%);作为对照,单假设配置只有 0.44%,多轮架构探索 0.58%。对排序模型来说,无吞吐代价的误差改善是可以直接进生产评估的候选,这正是「力倍增器」的含义:它未必替你做出天才设计,但能把专家注意力覆盖不到的模型长尾逐一犁一遍。

L1 工具可用性测试(实验排序模型 M*):装备比智商重要8%通用 LLM16%通用 ML 智能体68%领域装备 A-MLE差距最大的题型:作业配置修改——领域装备版全对,通用配置不到 40%另一层发现:固定智能体循环换模型,只有 Sonnet 3.5 以上、Gemini 2.5、GPT-5 能跑通工作流,其余模型会编造 workflow 编号、不会等异步任务;探索激进度上 Gemini 与 GPT-5 更冒进、Sonnet 更保守
图 2|同一道题三种配置:8%、16%、68%——领域技能库贡献了主要差距,跨 LLM 表现各有性格。

换个底座模型,性格全变

论文还做了一组漂亮的控制变量:固定智能体循环、技能与提示词,只换底层 LLM。L2 自主工作流执行层,Claude Sonnet 3.5 以上、Gemini 2.5 与 GPT-5 的任务完成度落在高位段,其余模型根本跑不通流程——编造工作流编号、不会等待异步任务完成。到了 L3 探索层,关系更微妙:默认提示下 Gemini 2.5 和 GPT-5 探索得更冒进,Sonnet 系偏保守;而换上施压式提示后格局翻转,Sonnet 4.0 给出了所有配置里最好的探索结果,GPT-5 反而收缩、把默认提示下的大部分收益退了回去。智能体系统的行为是 harness 与模型性格的合成物,换一层就换一副脾气。

对业内的参照价值在于三点:其一,企业里最该先让智能体接手的往往不是明星模型,而是没人管的那些;其二,技能库与沙箱的工程投入优先级高于反复换底座模型;其三,人机分工的正确粒度是阶段边界的检查点,既不是无人化也不是全程盯梢。失败模式一节论文写得坦率,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

它没有替代谁,它接住了没人接的活

和通用 AutoML、MLE-bench 这类基准线上的工作相比,A-MLE 的不同在于它是从真实生产栈里长出来的:任务结构来自真实的排序模型组合,失败模式来自真实的基础设施抖动。论文反复强调的判断是,harness 与领域技能的可靠性支配整体表现——这与站内近来多批拆解的结论相互印证,只是这次把场景换成了工业推荐系统。对大多数企业来说,短期内未必养得起这样一条智能体探索流水线,但它划定了一个清晰的参照点:当迭代循环本身成为可优化的对象,ML 团队的产出结构就会重新排座次——写假设、判结果的人升值,跑实验的人得换个位置。