Notas
Textos cortos sobre la metodología y las decisiones arquitectónicas detrás de los sistemas de IA que entrego — specs, evals, orquestación multi-agente, integración de LLMs y la disciplina de dirigir agentes de codificación.
4 de junio de 2026
87% en el benchmark, y aún no puede hacer evolucionar tu base de código
El titular dice que la IA 'resuelve el 87% de SWE-bench', y todos lo leen como 'la IA ya puede hacer ingeniería de software'. Dos problemas. El pequeño: un tercio de esos aciertos filtró la respuesta o tenía tests/pruebas débiles. El fatal: el benchmark mide un único arreglo de bug aislado, no el trabajo real — hacer evolucionar una base de código viva durante semanas. Mide eso, y los mismos modelos caen de ~73% a ~25%. El benchmark es la demo. Tu base de código es producción.
- eval
- agents
- methodology
3 de junio de 2026
La mayoría de los agentes de IA nunca llegan a producción
La demo deslumbra. Después, el agente nunca sale a producción. Encuesta tras encuesta en 2025–26 encuentran el mismo abismo: casi todos tienen un piloto de agente, casi nadie lo tiene en producción. La razón no es el modelo: es la ingeniería poco glamorosa que la demo te dejó saltarte. Esto es lo que hace distinto la pequeña minoría que sí lo lleva a producción.
- agents
- eval
- methodology
10 de mayo de 2026
Evals o no se entregó
Por qué me niego a llevar un agent a producción sin un set de evaluación held-out, qué hace que uno sea útil y el failure mode que sigo viendo cuando los equipos se lo saltan.
- agents
- eval
- methodology