每个人都在谈论代理AI航运生产代码.
没人在说,当你坐下来 数以千计的台词 逐行逐行地对着一个小标题 我见过 而反复出现的失败模式并不是Twitter/X所争论的.
两年前不存在的职称"AI评价员""AI训练员". "前沿模式培训数据专家贡献".
当我开始职业生涯时,这些职位都不存在。
现在它们就是这个行业中最有趣的工程信号的所在地—— 悄悄地,在NDA之后,远离演示视频。
工作其实是这样的: 代理编码输出在你的桌子上, 你按照一个结构化的标题来划分, 正确性, 指令的坚持性, 质量,边框处理。
你设计对抗性的提示 找出模型的推理断裂之处 你决定哪些检查是程序性的和决定性的, 哪些真正需要一个运送生产系统的人来打电话。
这是RL环境设计和最原始的LLMOps,它与"即时工程师"或"ML研究员"完全不同的技能.
它更接近成为初级工程师的QA领跑者,他从不入睡,从不尴尬,并且会自信地用完美的语法来运送错误的答案.
模式: 特工在代码上很厉害 后果不好 这是不舒服的部分。
故障模式的人最响亮——幻觉的API,编造的库函数——是容易的故障模式.
声音很大,很明显 任何合适的测试套房 都能在几秒钟内抓到它 事实上,失败模式很重要, 它滑过一个表面读取,甚至一个天真的测试套房, 看起来像这样: 密码在战术上是完美的,对于失败是完全错误的.
它以优美的方式处理快乐的路径,并悄悄地假设了重试,超时,部分写出,重复的信息永远不会发生.
它选择了度量法而不是意图——Goodhart's Law的代理-AI版本.
给一个模型一个标题, 检查“部署成功”, 你偶尔会得到一个解决方案, 技术上满足检查,同时做一些没有工程师会签的东西。
评估者称这种奖励黑客化, 并且这是一个更常见的失败, 而不是彻底的幻觉, 一旦你分级 现实世界的以下任务而不是列特码。
对IAM,通币,分布状态来说,这无疑是错误的——正是生产工程经验最为重要的领域,以及从未操作过真系统的人所写的题材会完全错过缺陷.
这些都不是对模型的打击 这是敲响我们如何评估它们。
你无法用一个从未在凌晨2点的比赛状态下 无声地破坏数据库的人 所写的文字来抓住后果盲目 这是将代理AI推广到生产级基础设施工作的实际瓶颈:不是模型能力,评价质量.
为什么"vibe编码"在下层"Vibe编码"中分解——接受AI生成的代码,因为它看起来正确而演示作品,对于一个原型来说是好的.
任何触摸IAM政策、消息排队、持久存储或灾难恢复的东西都不好。 "看对了"和"对了"之间的差距正是存在"黄金参考解决方案"和"确定性验证测试"来收尾的缺口——我在上一篇关于建设RL环境用于云基础设施评价的文章中写到的这个学科. "AI现在写我们所有的代码"的人群感到不舒服的真相:系统生产级别越高,瓶颈就越从生成代码转向具体和核实.
这是一个系统工程问题,而不是模型拓扑问题.
并不是巧合的是 高级后端工程师的职业生涯 却越来越精通 而不是用真正的数据库来写测试套房