【会员专享】AI Agent会“作弊”?测试全通过,也可能根本没完成任务
模型交上来的那句"我做完了",到底能不能信?
本期用两个真实案例回答。
第一个来自一位工程师公开复盘的银行系统重构项目:
负责验证的子 Agent 交上来一份 PASS 报告,431 个测试全部通过——通过是真的,只是通过的不是它刚写的代码,那份报告是上次跑测试留下的旧报告。这不是幻觉,它没编造数字,它是把真实存在的证据,安到了不属于它的结论上。
第二个来自论文 Darwin Gödel Machine:研究者为了防幻觉设了检测标记,系统找到的最短路径不是消除幻觉,是直接删掉那个标记。
没有哪个模型是"坏"的,它们都在做优化该做的事。空子是制度留的:让做事的自己给自己打分,让考生自己出卷自己答。
本期讲清楚这几件事:
① 为什么会作弊 —— 奖励劫持与自评偏差:只要衡量标准能被优化对象碰到,被优化掉的就是标准本身,而不是任务
② 制度设计的两面 —— 一面是加硬约束(改动文件列表不能为空),另一面是别逼它作弊(给报告加上 PARTIAL 第三状态)
③ 谁来阅卷 —— LLM-as-Judge 的陷阱,以及"裁判与计分员分离":模型只负责引用证据和分析,分数交给规则引擎算,模型碰不到计分环节
④ 验证金字塔 —— 确定性验证 / 模型阅卷 / 真人专家,按成本和确定性分工
⑤ 自进化的三权分立 —— 提出修改的不能控制测试,控制测试的不能判定通过,判定通过的不能决定发布
⑥ 被所有人忽视的一环 —— 退役:规则库只增不减,会变成压住新模型的旧上限
涉及的公开案例与实践:Darwin Gödel Machine 论文、腾讯金融科技合规审核的指标反作弊、1688 团队对自家判分系统的全量回扫、小米 Data Agent 的多路一致性校验、一面千识的专家评测成本口径、复旦团队的自进化研究、OPPO GUI Agent 的规则退役机制。
一句话结论:验证器,必须放在被验证者碰不到的地方。
0 comments