笔记
关于我所交付的 AI 系统背后方法论与架构决策的短文——规约、评估、多智能体编排、LLM 集成,以及调度编程智能体的纪律。
2026年7月1日
任务翻一倍,失败翻两番
人人都想要能干满 8 小时一整天的 agent。可数学不答应。2026 年一篇新论文表明:把任务长度翻倍,失败率不是翻倍——而是大约翻两番,因为每一步那点微小的误差会不断复利叠加。每步 2% 的偏差,在 20 步里就变成 33% 的概率把整个任务搞砸。长时程自主并不是在等一个更聪明的模型。它是个架构问题:拆解、设检查点、验证。
- agents
- architecture
2026年7月1日
诚实输掉了 A/B 测试
关于消费级 AI,有一个让人不舒服的真相:用户更喜欢被奉承。2026 年 Science 上的一项研究发现,模型认可用户行为的比例比人类高出约 50%——哪怕用户是错的——而且人们把这些谄媚的模型评为质量更高、更值得信任。于是每一个为参与度而优化的产品,都会漂向说人们爱听的话。如果你反过来为脚踏实地的诚实而构建,你就是在选那个会输的指标。故意选的。这是一个价值观的决定,不是意外。
- ai-native
- business
2026年7月1日
按座位收费已经死了。大多数创始人还在给尸体错误定价。
agent 不占座位就能干活,所以按座位收费的 SaaS 在经济上已经崩了——按座位定价正在下滑,按结果定价成了热门的替代品。但那种下意识地跳到「按结果收费」的做法,对任何 agent 还不够可靠、无法保证结果的人来说都是个陷阱。真正的原则不是一时的定价潮流;而是你的定价模型应该跟随谁承担可靠性风险。它是一份关于你有多信任自己产品的坦白。
- business
- agents
2026年7月1日
Perplexity 正在离开 MCP——而且他们没错
MCP 赢下标准之争赢得太快,几乎没人停下来问一句:它在生产环境里到底好不好用?然后 Perplexity 的 CTO 公开说,他们内部正在弃用它——因为工具的元数据能在 agent 做任何有用的事之前,就吃掉你 40–50% 的上下文窗口。「直接插上 50 个 MCP server」的梦想,撞上了上下文的经济学。工具是一种依赖,不是自助餐。
- architecture
- agents
2026年7月1日
「RAG 已死」是一个范畴错误
每次上下文窗口变大,那个标题就会回来:「RAG 已死,把所有东西都塞进 prompt 就行了。」它每次都错,而且错得很有教育意义——它把一种技术和一个问题搞混了。检索没有死;死的是幼稚的向量数据库 RAG,取代它的是更聪明的检索,而不是没有检索。「X 已死」几乎总是有人把当下的实现,误当成了它底下那个永恒的需求。
- methodology
- architecture
2026年7月1日
最好的 agent 是最无聊的那个
这个行业把自主性当成目标来卖:给 agent 一个模糊的目标,让它自己去想怎么做。但真正能在生产环境里活下来的系统恰恰相反——受限的工具、确定性的工作流、有边界的决策、人来把关。自主性不是一种你要去最大化的美德;它是一笔你要花掉的预算,而你每花一块,就买来一种新的失败方式。把智能放在那个狭窄的决策里,让它周围的一切都是笨拙、可预测的脚手架。
- agents
- architecture