AI效能测量04:指标到手后——为何不应将其设为个人考核目标
摘要:AI 效能指标一旦转为个人 KPI,便会从观察工具蜕变为分数竞赛。本文借助 Goodhart、METR、IBM、CMU 的证据,破除排名冲动,明确度量与监控的界限。上篇结尾,你已能整合 ccusage 和 GitHub 生成报表。cost_per_pr、revert_rate、cache_hit_rate,每人一行,清晰可见。报表导出那一刻,最危险的想法也会浮现:“按 PR 数量排序,发到群里,大家就会更积极使用 AI。”停住。这篇只劝一件事:别将 AI 效能指标设为个人 KPI,别做排行榜。它不是
AI编程实践中的常见缺陷与诊断框架
AI编程已进入企业级应用阶段,但多数团队在新鲜感消退后,会遭遇同样的困境:AI生成的代码"表面看起来没问题,运行时就暴露缺陷"。这些问题并非偶发,而是具有规律性——它们可以被提炼、分类和诊断。本文总结了AI编程中的典型缺陷模式(Bad Smell)。这些并非简单的"AI表现不佳"这样模糊的评价,而是精确到可操作层面的诊断框架。这是最基础也最容易被忽视的一类问题。AI并非真正"记住"信息,而是在上下文窗口内进行模式匹配。一旦上下文超出窗口范围或被污染,AI的表现就会下降。主要表现:上下文衰减(Context