Notas
Textos cortos sobre la metodología y las decisiones arquitectónicas detrás de los sistemas de IA que entrego — specs, evals, orquestación multi-agente, integración de LLMs y la disciplina de dirigir agentes de codificación.
5 de junio de 2026
«¿Qué parte agentizamos primero?» es la primera pregunta equivocada
Todo el mercado pasó de '¿son reales los agentes?' a '¿qué parte de mi empresa se agentiza primero?' — soporte de TI, ventas, conciliaciones. Parece la pregunta estratégica inteligente. Es la equivocada. Preguntar dónde apuntar el agente se salta las dos preguntas que de verdad deciden si algo de esto funciona: sobre qué se apoya el agente, y quién responde cuando se equivoca. Este es el orden que importa.
- methodology
- business
- agents
4 de junio de 2026
87% en el benchmark, y aún no puede hacer evolucionar tu base de código
El titular dice que la IA 'resuelve el 87% de SWE-bench', y todos lo leen como 'la IA ya puede hacer ingeniería de software'. Dos problemas. El pequeño: un tercio de esos aciertos filtró la respuesta o tenía tests/pruebas débiles. El fatal: el benchmark mide un único arreglo de bug aislado, no el trabajo real — hacer evolucionar una base de código viva durante semanas. Mide eso, y los mismos modelos caen de ~73% a ~25%. El benchmark es la demo. Tu base de código es producción.
- eval
- agents
- methodology
4 de junio de 2026
Tus agentes son sin estado. Por eso mueren.
Tu agente termina de principio a fin en tu laptop, así que nunca ves el problema. Producción es un proceso largo de múltiples pasos sobre infraestructura que se reinicia, expira y muere a mitad de camino — y tu agente guardó todo su progreso en memoria. El 'ajuste de cuentas agéntico' de 2026 es el descubrimiento de que la falla no está en el modelo, está en el runtime. El arreglo es viejo y aburrido: durable execution (ejecución durable). Aquí va la versión honesta.
- architecture
- agents
- methodology
4 de junio de 2026
Tokenmaxxing, o cuando la ley de Goodhart viene por la IA
Las empresas querían 'adopción de IA', así que midieron el proxy más fácil — el uso de tokens —, lo pusieron en una tabla de clasificación (leaderboard) y obtuvieron exactamente lo que midieron: gente quemando tokens para escalar en la tabla, no para hacer mejor trabajo. Es una ley de cincuenta años devorando una estrategia recién estrenada, y ahora sale cara dos veces: pagas por los tokens desperdiciados y envenenas la señal que querías. El arreglo también es viejo — mide resultados, no actividad.
- methodology
- business
4 de junio de 2026
Tu organigrama no puede correr agentes
Todo ejecutivo se pregunta '¿ya es lo bastante bueno el modelo?'. Nuevos datos del MIT dicen que esa es la pregunta equivocada: el 85% de las organizaciones quiere ser agentic (agéntico), pero el 76% admite que sus propias operaciones no pueden soportarlo. El bloqueo no es la capacidad del modelo, es que las empresas están atornillando un nuevo tipo de trabajador a un organigrama dibujado para humanos. Un agente no tiene jefe, ni escalera de carrera, tiene permisos acotados y una tasa de alucinación. Aquí está la casilla que le falta a tu organigrama.
- business
- methodology
- ai-native
3 de junio de 2026
La mayoría de los agentes de IA nunca llegan a producción
La demo deslumbra. Después, el agente nunca sale a producción. Encuesta tras encuesta en 2025–26 encuentran el mismo abismo: casi todos tienen un piloto de agente, casi nadie lo tiene en producción. La razón no es el modelo: es la ingeniería poco glamorosa que la demo te dejó saltarte. Esto es lo que hace distinto la pequeña minoría que sí lo lleva a producción.
- agents
- eval
- methodology