笔记
关于我所交付的 AI 系统背后方法论与架构决策的短文——规约、评估、多智能体编排、LLM 集成,以及调度编程智能体的纪律。
2026年7月3日
你没法给一次掷骰子写单元测试
开发者把一个 LLM 塞进系统,围着它写一个普通的通过/失败测试,眼看着它时灵时不灵,然后要么删掉测试,要么把模型 mock 到毫无意义。两种做法都错。一个概率性组件在结果有波动时并不是坏了——但「它会波动」不是停止测试它的通行证。你只是得改成去测分布,而不是测样本:给一组黄金样例带容差打分、用通过率把关、断言每次都必须成立的不变量,并在随机的内核和它外围确定性的外壳之间画一条硬边界。
- methodology
- eval
2026年7月1日
AI 制造的代码债不会被偿还,它会悄悄复利
AI 生成代码的代价,不是你在评审里抓到的那个 bug——而是那个存活下来、无人认领、整个团队都没人有心智模型的缺陷。2026 年一项针对 30 万+ AI 编写提交的研究发现,AI 引入的问题里有将近四分之一至今仍留在 HEAD。人类的债之所以被还清,是因为有人记得自己写过它;AI 的债只会不断累积,因为根本没人写过它。真正的对冲不是更多测试覆盖率,而是理解。
- architecture
- methodology
2026年7月1日
「RAG 已死」是一个范畴错误
每次上下文窗口变大,那个标题就会回来:「RAG 已死,把所有东西都塞进 prompt 就行了。」它每次都错,而且错得很有教育意义——它把一种技术和一个问题搞混了。检索没有死;死的是幼稚的向量数据库 RAG,取代它的是更聪明的检索,而不是没有检索。「X 已死」几乎总是有人把当下的实现,误当成了它底下那个永恒的需求。
- methodology
- architecture
2026年7月1日
瓶颈已经移动了。你还在优化那个旧的。
三十年来,软件里稀缺的资源是写代码,于是我们把一切都围绕打字速度来优化。AI 让写代码几乎变得免费——而约束悄悄地挪到了验证上:读懂、信任、接受产出。大多数团队从没重组过。他们还在往一个瓶颈已经变成「评审」的漏斗里灌更多水,然后纳闷为什么「更快」并没有让人感觉更快。速度指标在撒谎,因为它们衡量的是那已经不再是瓶颈的另一半。
- methodology
- ai-native
2026年7月1日
「workslop」不是生产力。它是一种税。
AI 本该替我们干那些琐碎杂活。可在很多团队里它干的恰恰相反:它生成看上去像模像样的产出,逼着下游的人去辨认、去破译、去重做。研究者给它起了个名字,叫「workslop」,而数字很难看——53% 的白领说自己收到过,每一次平均要花 ~2 小时收拾,还悄悄毒化同事之间的信任。这不是生产力的提升,而是生产力的转移——账单落到了下游某个人头上。
- business
- methodology
2026年7月1日
你那百万 token 的上下文窗口在骗你
厂商把上下文长度当 RAM 来卖:越大越好,把所有东西都塞进去就行。但注意力并不均匀。研究一次又一次发现同样的 U 形——模型会稳定地用到窗口的开头和结尾,却悄悄忽略中间部分,一旦重要的东西被埋在那里,准确率会掉 30%+,有时才 10k token 就开始了。上下文不是一个你往里装东西的桶。它是一种稀缺的、跟位置有关的资源,需要你去设计。「全都放进 prompt 里」就是新的过早优化。
- architecture
- methodology