Заметки
Короткие тексты о методологии и архитектурных решениях в AI-системах, которые я довожу до продакшена: спецификации, evals, мультиагентная оркестрация, LLM-интеграции и дисциплина работы с coding-агентами.
3 июля 2026 г.
Нельзя юнит-тестить бросок кости
Разработчик встраивает LLM в систему, пишет вокруг обычный тест «прошёл/не прошёл», видит, что он флакает, и дальше либо удаляет тест, либо мокает модель до бессмысленности. Оба варианта неверны. Вероятностный компонент не сломан, когда варьируется, — но «оно варьируется» не даёт права перестать его тестировать. Просто надо тестировать распределение, а не единичный сэмпл: оценивать золотой набор с допуском, ставить порог на процент прохождений, проверять инварианты, которые обязаны держаться каждый раз, и держать жёсткую границу между стохастическим ядром и детерминированной оболочкой вокруг него.
- methodology
- eval
1 июля 2026 г.
ИИ-долг в коде не гасится. Он тихо компаундится.
Цена ИИ-кода — не баг, который ловишь на ревью, а изъян, который выживает, ничей, в кодовой базе, ментальной модели которой нет ни у кого. Исследование 2026 года по 300k+ ИИ-коммитов нашло, что почти четверть внесённых ИИ проблем всё ещё на HEAD. Человеческий долг гасится, потому что кто-то помнит, как его писал. ИИ-долг просто накапливается, потому что не писал никто. Единственная реальная страховка — не больше покрытия тестами. Это понимание.
- architecture
- methodology
1 июля 2026 г.
«RAG умер» — это категориальная ошибка
Каждый раз, когда окна контекста растут, возвращается заголовок: «RAG умер, просто клади всё в промпт». Он неверен каждый раз, и неверен по поучительной причине — он путает технику с проблемой. Retrieval не умер; умер наивный vector-database RAG, и его заменяет более умный retrieval, а не отсутствие retrieval. «X умер» почти всегда — это звук того, как кто-то путает текущую реализацию с постоянной потребностью под ней.
- methodology
- architecture
1 июля 2026 г.
Бутылочное горлышко сместилось. А ты всё оптимизируешь старое.
Тридцать лет дефицитным ресурсом в софте было написание кода, и мы оптимизировали всё вокруг скорости набора. ИИ сделал написание почти бесплатным — и ограничение тихо переехало в верификацию: чтение, доверие, приёмку. Большинство команд не перестроились. Они льют больше воды в воронку, горлышко которой теперь — ревью, и удивляются, почему «быстрее» не ощущается быстрее. Метрики скорости врут, потому что меряют ту половину, которая больше не бутылочное горлышко.
- methodology
- ai-native
1 июля 2026 г.
«Workslop» — это не продуктивность. Это налог.
ИИ должен был забирать рутину. Во многих командах он делает обратное: производит правдоподобный на вид результат, который человек ниже по потоку вынужден распознавать, расшифровывать и переделывать. Исследователи назвали это «workslop», и цифры некрасивые — 53% офисных работников получали такое, каждый случай стоит ~2 часа на разбор, и это тихо отравляет доверие между коллегами. Это не прирост продуктивности. Это её перенос — и счёт оплачивает кто-то ниже по потоку.
- business
- methodology
1 июля 2026 г.
Твоё окно на миллион токенов тебе врёт
Вендоры продают длину контекста как RAM: больше — строго лучше, просто впихни всё. Но внимание не равномерно. Исследования снова и снова находят одну и ту же U-образную кривую: модель надёжно использует начало и конец окна и тихо игнорирует середину, а точность падает на 30%+, как только важное закопано туда, — иногда уже после 10k токенов. Контекст — не ведро, которое наполняешь. Это дефицитный, позиционный ресурс, который проектируешь. «Впихни всё в промпт» — это новая преждевременная оптимизация.
- architecture
- methodology