AI 工程周刊 · 每周十篇非显而易见的工程洞察
大规模 AI 迁移的真正交付物不是"正确的代码",而是一套把每个反复失败"提拔"成规则的自我改进流水线。
两周之内,Bun 的 Zig→Rust 迁移由 Claude Code 产出超过 100 万行代码,合并前在 CI 通过 100% 原有测试,合并后仅 19 个回归且全部修复——代价是 59 亿 uncached input token 加 6.9 亿 output token,按 API 价约 16.5 万美元。
这组数字之所以重要,是因为它把"AI 大规模落地"从传闻变成了有成本、有质量、可复算的工程范式。Krieger 的 Python→TypeScript 迁移(16.5 万行)把每次发布构建从每平台约 8 分钟压到约 2 秒,二进制启动快 6×,并让团队退役了一整条部署流水线。真正被影响的是所有面对"历史代码库现代化"的工程团队。
Anthropic 的做法把迁移拆成规则手册、缺口清单、机械化任务队列与对抗式审查四件套,并按流水线阶段分配模型档位——便宜模型做机械实现、贵模型做审查与写规则。值得关注的是:每一个复现失败都被固化成规则而非一次性补丁,这让流水线越跑越准,也把"模型选型"本身变成一个成本杠杆。
"当模型能力不再是瓶颈,AI 工程的胜负手正转移到 harness、循环与上下文——以及我们是否清醒地知道 Agent 与人类各自的盲区在哪。"
— 本周主题
LLM 在知名开源代码上的「自信」是训练数据的记忆复述,而非真正的代码导航——它冷启动答对 100% 有文档的公开 API,却只找到 1/6 无文档的内部依赖,恰恰在从未进训练集的私有代码库上被系统性高估。
▸ 点击展开详情
接入结构化「代码地图」工具后平均引用召回 +0.26(Opus),「谁依赖谁」子任务 +0.48;提升随规模放大——2500 文件以上仓库全部 ≥+0.25(Chatwoot +0.68、Mastodon +0.54),2000 文件以下全部 ≤+0.17。冷启动在 Chatwoot 上 11 个依赖只找到 2/11。
别用模型在开源明星项目上的表现评估它在你私有库上的能力;大型代码库(>2500 文件)给 Agent 接依赖图/代码地图,而非指望更大上下文窗口或 grep。
在紧耦合高复杂度代码库上,Agent 的有用产出不再是「bug 列表」,而是「关于模块假设与外包不变量的知识」;如何把它以恰当粒度表达(不短到漏 bug、不长到爆父级上下文)才是真正未解的上下文工程问题。
▸ 点击展开详情
标准「一子智能体审一模块 +300K~1M token」并行审计,在 OpenVM zkVM 上两轮全部 triage 成 Informative——0 真 bug。专用流 cryptopsy 扫 9.5+ 小时挖出 Critical CVE-2026-46669:pairing 缩放因子漏子域成员检查,令 c=1 即可伪造任意 pairing 等式,击穿 Groth16/KZG/BLS。
别把「LLM 写个 PoC 跑通」当 triage 信号——模型很擅长为不存在的 bug 造出能过的 PoC;紧耦合系统要设计跨模块知识传播,而非无脑并行分片。
元 RL 循环中,Agent 先学会「可靠」(过校验、不让 GPU 崩)远早于学会「优秀」(产出更好模型)——早期奖励全来自把失败任务变成完成任务,训练质量提升要到之后才启动。
▸ 点击展开详情
Qwen3.6-35B agent(LoRA rank 8)被训练去为小模型写 RL 任务;54 步外循环全程约 $1275。修好「总选更弱模型」这一顽固坏策略的,不是更多步数,而是新增 get_baseline_scores 工具 + 改成基于 uplift 的奖励——之后选更大 1.7B 模型比例从 42% 跳到 95%。
诊断 Agent 训练先分离「过程可靠性」与「结果质量」两条奖励曲线;卡在坏策略时优先给新工具、重塑奖励函数,而非无脑加训练步数。
粗糙的 max_iterations 停止规则可用百年前的反馈控制结论替代——测相邻误差之比(经验「环路增益」)直接告诉你循环在收敛、震荡还是发散,与任务内容无关。
▸ 点击展开详情
2000 组配对试验显示:相比 max_iterations=20,用 Barkhausen 判据分 5 态止损,API 开销↓92.8%($27.05→$1.94),中位墙钟快约 15×。作者也诚实量化失效:4.5% 判「收敛」的运行过了环内检查却挂掉完整测试集——它测的是收敛,不是正确性。
给 Agent 循环加基于误差斜率 + 显著性检验 + 震荡残差的收敛分类器止损,而非固定迭代上限;但「收敛≠正确」,仍需 held-out 验证。
自主默认值的危险不在于它存在,而在于它被放在控制流哪一层——Claude Code 的 60 秒超时被放进「用户决策」层,而这正是自动化/白名单化流水线早已不再设卡的一层。
▸ 点击展开详情
2.1.198(changelog 未记录)让 AskUserQuestion 60 秒无操作后按「最佳判断」自动继续,带着模型对未答问题的猜测提交。权限提示被豁免于计时器,但对已白名单化权限的流水线,「上生产还是 staging?」才是最后一道闸,正是被静默覆盖的那道。issue 三天 384 赞,2.1.200 改回 opt-in。
审查你依赖的 harness 每次静默默认变更;对已 bypass 权限的流水线,把关键决策钉在不会超时自动放行的确认层,并锁定/监控 harness 版本。
无人值守 computer-use 自主要解决一个 OS 级身份问题——macOS 把屏幕/输入授权绑在实际调用 API 的进程上,必须让常驻 tmux server(而非临时 claude 进程)持有 GUI 会话权限。
▸ 点击展开详情
SSH 进去的 claude 够不到显示器;解法是 LaunchAgent 托管跑在 GUI 登录会话里的 tmux server,把授权给 tmux 而非 claude,授权后须重启 tmux 才生效。此外 macOS 插电也 ~10 分钟休眠(需 pmset disablesleep),Tailscale 密钥 ~180 天过期会静默掉线。
跑无人值守 Agent 用一台无 Apple ID、无个人数据的可擦除备用机做物理隔离,而非在主力机做权限沙箱;授权钉在常驻守护进程上,并处理休眠与密钥过期。
砍 Agent 成本的真正杠杆不是更便宜的模型,而是认清被反复运行的工作流大部分在重放固定流程——而按 token 收费的厂商没动力帮你发现这点。
▸ 点击展开详情
把每天跑的自然语言 Agent Skill 重写成确定性 Python harness、只在两个判断步骤调 LLM 后,同一模型下 token↓94%、延迟↓87%、质量无损。方法:把 NL skill + 历史 trace 喂给强模型,让它识别哪些步骤已「结晶」成确定性代码。
高频工作流先用自然语言跑一阵、靠 trace 摸清真实形状,再把稳定的确定性部分「编译」成代码,只在需判断处留 LLM;一次性编译成本被成百上千次运行摊薄。
当开源权重模型在成本与多数工作负载上已与闭源趋同,真正的「拥有者 vs 租户」之争上移一层——到 agentic harness 及其尚未解决的写权限模型,而非停留在模型权重较量。
▸ 点击展开详情
Chatbot Arena 开闭差距 2026 年 3 月收窄到 3.3%(两年前 8.04%);推理价 36 个月跌 50×。但「采用≠上生产」:79% 开发者用开源 vs 71% 闭源,可只有 51% 开源团队进生产 vs 闭源 63%,差距主因是运营流失而非能力。
选型别只看基准差距——中性脚手架上 GLM 5.2 以 $0.43/任务拿 67.8%,Opus 4.8 以 $2.41/任务拿 71.9%;把预算投在 harness 与运维成熟度上,可能比追逐前沿更决定能否上生产。
只要 AI 建议「可得」——哪怕来自通常答错的模型——就会压制人天生的认知谦逊,让人同时更不准确、更自信,连现金激励都只能部分逆转。
▸ 点击展开详情
AI 建议可得时,愿说「我不知道」的比例从 44% 崩到 3%,准确率从 27% 跌到 9%,自报信心从 30% 升到 76%。加金钱激励也几乎没用(认错回到 8%、准确率 16%)。对 AI-native 产品设计是直接警示:助手是否表达不确定性会重塑用户判断质量。
设计 AI 辅助产品别默认「给答案」就是好体验——强制模型表达置信度、保留并奖励用户「我不知道」的选项,把校准而非流畅作为评估指标。
本周的信号异常一致:AI 工程的主战场已经越过"模型能不能做",全面转入"如何在模型之外把系统工程做对"。Anthropic 公布的百万行迁移把大规模落地量化成成本与规则的工程问题;LoopGain 用百年前的控制论判据替掉粗糙的 max_iterations,把 Agent 循环止损做成可测量的科学;vivekhaldar 把高频工作流"编译"成确定性 harness,一举砍掉 94% token。与此同时,一批研究在给热潮降温:5 模型 ×13 库的基准揭示 LLM 在私有代码上的导航能力被系统性高估,朴素多智能体审计在紧耦合系统上找不到真 bug,而一个悄悄上线的 60 秒超时默认值,绕过了自动化流水线里最后的人类关卡。开源报告则指出,能力差距已收窄到 3.3%,真正的护城河上移到了 harness 与写权限模型。把这些放在一起:能力不再稀缺,稀缺的是把自主性、上下文与人机边界工程化的纪律。