笔记
关于我所交付的 AI 系统背后方法论与架构决策的短文——规约、评估、多智能体编排、LLM 集成,以及调度编程智能体的纪律。
精选
最新
2026年7月3日
AI 本该比雇个人更便宜
用一个智能体去替换一个岗位,整套商业逻辑就归结为一个数字:模型比工资便宜。到了 2026 年账单开始落地,这个数字不再成立了——Forbes 打出了「AI 可能比它替换掉的人更贵」的标题,Uber 大约四个月就烧光了全年的 AI 预算,Meta 不得不给自家工程师设上限。你换上智能体的时候并没有把工作删掉。你只是把一份固定的工资,换成了一张按量计费的 token 账单,外加如今用来检查、纠正和给它擦屁股的资深人力时间。做裁员之前先把这笔账算清楚。
- business
- careers
2026年7月3日
提示词注入不是一个你能打补丁修掉的 bug
各个团队一直把提示词注入当成一个普通的漏洞——一个终有一天会被某次模型更新或某个聪明过滤器堵上的漏洞。堵不上的。OWASP 的 2026 报告和越来越多的研究者如今把它描述为 LLM 工作方式的一个永久性质:模型是真的分不清你的指令和它正在读的数据。一旦你接受这一点,工作就变了。你不再试图阻止注入,而开始确保一次成功的注入干不成任何破坏——归根结底就是:永远别让单个智能体同时握有那三种能把一个被投毒的输入变成一次入侵的权力。
- security
- architecture
2026年7月3日
会重写自己的智能体没有规格可言
新的卖点是「自我进化」的智能体——它在运行时自行调整行为,于是你永远不用去更新它。ServiceNow 和 NVIDIA 刚把这么一个东西对准了你的桌面。但生产软件最需要的东西只有一样:一个你能拿来做校验的固定目标。一个会重写自己逻辑的智能体,就是一套「你测过的东西不等于下周在跑的东西」的系统。让它在你能读、能重置的数据里学习——绝不要让它在你无法盯着看的行为里悄悄改变。
- agents
- architecture
2026年7月3日
模型被商品化了。芯片没有。
两年来整场游戏比的都是哪个模型最聪明。这场游戏要结束了:Claude Sonnet 5 以极低的价格达到了接近 Opus 级的质量,各家实验室在拼成本而不是拼智商,而换供应商如今只是改一处配置。当能力层被商品化,护城河就会顺着技术栈往下滑——滑到推理硅片和机架上。OpenAI 刚流片了自己的芯片。这对我们其余在上层搭东西的人意味着什么:你每个 token 的价格地板,是由上面两层、由你永远不会见到的人设定的,所以就照这个来设计。
- business
- architecture
2026年7月3日
你没法给一次掷骰子写单元测试
开发者把一个 LLM 塞进系统,围着它写一个普通的通过/失败测试,眼看着它时灵时不灵,然后要么删掉测试,要么把模型 mock 到毫无意义。两种做法都错。一个概率性组件在结果有波动时并不是坏了——但「它会波动」不是停止测试它的通行证。你只是得改成去测分布,而不是测样本:给一组黄金样例带容差打分、用通过率把关、断言每次都必须成立的不变量,并在随机的内核和它外围确定性的外壳之间画一条硬边界。
- methodology
- eval
2026年7月1日
AI 制造的代码债不会被偿还,它会悄悄复利
AI 生成代码的代价,不是你在评审里抓到的那个 bug——而是那个存活下来、无人认领、整个团队都没人有心智模型的缺陷。2026 年一项针对 30 万+ AI 编写提交的研究发现,AI 引入的问题里有将近四分之一至今仍留在 HEAD。人类的债之所以被还清,是因为有人记得自己写过它;AI 的债只会不断累积,因为根本没人写过它。真正的对冲不是更多测试覆盖率,而是理解。
- architecture
- methodology