Заметки
Короткие тексты о методологии и архитектурных решениях в AI-системах, которые я довожу до продакшена: спецификации, evals, мультиагентная оркестрация, LLM-интеграции и дисциплина работы с coding-агентами.
4 июня 2026 г.
87% на бенчмарке — и всё ещё не вывозит эволюцию твоего кода
Заголовок гласит, что ИИ «решает 87% SWE-bench», и все читают это как «теперь ИИ умеет в инженерию ПО». Две проблемы. Маленькая: треть этих успехов слила ответ или прошла на слабых тестах. Фатальная: бенчмарк мерит один изолированный багфикс, а не настоящую работу — эволюцию живого кода неделями. Померь это — и те же модели падают с ~73% до ~25%. Бенчмарк — это демо. Твой код — это прод.
- eval
- agents
- methodology
3 июня 2026 г.
Большинство ИИ-агентов так и не доходят до прода
Демо ослепляет. А потом агент так и не выходит в релиз. Опрос за опросом в 2025–26 находят один и тот же обрыв: пилот есть почти у всех, в проде — почти ни у кого. И дело не в модели, а в неблагодарной инженерии, которую демо позволило пропустить. Вот что делает иначе то меньшинство, которое реально доводит до прода.
- agents
- eval
- methodology
10 мая 2026 г.
Eval или не выпущено
Почему я отказываюсь выпускать агента без holdout evaluation, что делает eval полезным и какой failure mode я регулярно вижу, когда команды это пропускают.
- agents
- eval
- methodology