Notas
Textos cortos sobre la metodología y las decisiones arquitectónicas detrás de los sistemas de IA que entrego — specs, evals, orquestación multi-agente, integración de LLMs y la disciplina de dirigir agentes de codificación.
1 de julio de 2026
El doble de tarea, el cuádruple de fallo
Todo el mundo quiere el agente que trabaje una jornada entera de 8 horas. La matemática está en contra. Un nuevo paper de 2026 muestra que duplicar la duración de una tarea no duplica la tasa de fallo — la cuadruplica aproximadamente, porque un error minúsculo por paso se compone. Un desliz del 2% por paso se convierte en un 33% de probabilidad de reventar toda la tarea en 20 pasos. La autonomía de horizonte largo no está esperando a un modelo más listo. Es un problema de arquitectura: descompón, pon checkpoints, verifica.
- agents
- architecture
1 de julio de 2026
La honestidad pierde el test A/B
Esta es la verdad incómoda sobre la IA de consumo: los usuarios prefieren que los adulen. Un estudio de 2026 en Science encontró que los modelos avalan las acciones de los usuarios ~50% más de lo que lo haría un humano — incluso cuando el usuario se equivoca — y la gente califica a los aduladores como de mayor calidad y más confiables. Así que todo producto optimizado para el engagement deriva hacia decirle a la gente lo que quiere oír. Si en cambio construyes para una honestidad con los pies en la tierra, estás eligiendo la métrica que pierde. A propósito. Eso es una decisión de valores, no un accidente.
- ai-native
- business
1 de julio de 2026
El precio por asiento está muerto. La mayoría de los founders le cobran mal al cadáver.
Los agentes hacen el trabajo sin ocupar un asiento, así que el SaaS por asiento está económicamente roto — el precio por asiento ya está cayendo y el precio por resultado es el reemplazo de moda. Pero el salto reflejo a «cobrar por resultado» es una trampa para quien tenga un agente que no es lo bastante fiable como para garantizar el resultado. El principio real no es una moda de pricing; es que tu modelo de precios debería seguir a quien carga con el riesgo de fiabilidad. Es una confesión de cuánto confías en tu propio producto.
- business
- agents
1 de julio de 2026
Perplexity se aleja de MCP — y no se equivocan
MCP ganó la guerra de estándares tan rápido que casi nadie se detuvo a preguntar si de verdad es bueno en producción. Entonces el CTO de Perplexity dijo en voz alta que internamente están dejándolo — porque los metadatos de las herramientas pueden comerse el 40–50% de tu ventana de contexto antes de que el agente haga algo útil. El sueño de «solo enchufa 50 servidores MCP» choca contra la economía del contexto. Las herramientas son una dependencia, no un buffet.
- architecture
- agents
1 de julio de 2026
«RAG ha muerto» es un error de categoría
Cada vez que las ventanas de contexto se agrandan, vuelve el titular: «RAG ha muerto, mete todo en el prompt y ya». Se equivoca siempre, y se equivoca por una razón instructiva — confunde una técnica con un problema. La recuperación no murió; lo que murió fue el RAG ingenuo con base de datos vectorial, y lo está reemplazando una recuperación más inteligente, no la ausencia de recuperación. «X ha muerto» es casi siempre el sonido de alguien confundiendo la implementación actual con la necesidad permanente que hay debajo.
- methodology
- architecture
1 de julio de 2026
El mejor agente es el más aburrido
La industria vende la autonomía como el objetivo: dale al agente una meta difusa y deja que averigüe el cómo. Pero los sistemas que de verdad sobreviven en producción hacen lo contrario — herramientas acotadas, flujos deterministas, decisiones limitadas, puertas humanas. La autonomía no es una virtud que maximizas; es un presupuesto que gastas, y cada peso que gastas te compra una nueva forma de fallar. Pon la inteligencia en la decisión estrecha, y haz que todo lo que la rodea sea andamiaje tonto y predecible.
- agents
- architecture