Todo lo que aprendo sobre IA, por escrito
Escribo en mi blog desde 2006. Hoy casi todo es sobre trabajar con LLMs: qué funciona, cuánto cuesta y qué es marketing. Cada post se publica en inglés y portugués.
Cada modelo importante, probado en la misma app saboteada
La versión 4 es una app Rails que crece a lo largo de siete sprints mientras un subagente aislado planta catorce sabotajes basados en CVEs reales. Los modelos se ordenan por vigilancia: ¿notaron lo que estaba roto y lo arreglaron? Reconstruí el benchmark desde cero por tercera vez para llegar a esto.
Cuando sale un modelo de frontera importante, pasa por la misma tabla. La última ronda sumó 5 modelos el 23 de septiembre de 2026. Así elijo qué modelo usar para qué, y cuánto cuesta cada uno por tarea.
- 44
- modelos en el ranking
- 14
- sabotajes por detectar
- 7
- sprints por corrida
- $4000+
- gastados en 9 días

Benchmarks
Los datos detrás de mis elecciones de modelos, y cómo cambió el método cuando las pruebas viejas se saturaron.
LLM Benchmark v4: Opus 5.5, GPT 6 Sol y Luna, MiMo 2.6, Grok 4.7
Cinco modelos nuevos entran en la tabla v4. Si vale la pena actualizar y por qué Grok 4.7 retrocede frente a su propio predecesor.
Nuevo LLM Benchmark v4, parte 1: el proceso
Por qué tiré a la basura una versión entera, cómo funciona la app Rails saboteada y cuánto costó: más de 4.000 dólares en nueve días.
Nuevo LLM Benchmark v4, parte 2: 39 modelos en el ranking
La tabla completa, ordenada por vigilancia. Seis empates en la cima, un modelo gratuito que supera a la mitad de Claude y el costo frente a la puntuación.
Benchmarks de LLM: ¿vale la pena mezclar modelos en un proyecto?
Siete combinaciones entre Claude Code, opencode y Codex, y por qué un solo modelo fuerte siguió siendo la opción por defecto.
Cómo trabajo con agentes
El proceso, las skills y las redes de seguridad que permiten que una persona mantenga tantos proyectos.
Hablando un poco de mis skills de IA
Las skills son prompts en archivos de texto. Las mías cerraron más de mil PRs e issues. Léelas y luego escribe las tuyas.
Deja de poner excusas y publica más
Con modelos de frontera que se equivocan menos que la mayoría de los desarrolladores, la burocracia de revisión es la última excusa para frenar un deploy. Mis números desde febrero.
Contribuciones de IA a proyectos de código abierto: mi opinión
Los pull requests hechos con IA llegaron para quedarse, basura incluida. Automatiza el triaje y la auditoría, y deja la decisión final en manos humanas.
Buenas prácticas de código abierto con LLMs: lo mínimo
Instalación sencilla, tests y CI confiables, y documentación sobre el problema. Versiones estándar hacen que la automatización sea predecible.
Clean Code para agentes de IA
Cuando el lector principal es un agente: código pequeño, nombres fáciles de buscar con grep, procedencia, tests headless y reglas explícitas.
Cómo evito que mis agentes borren mis cosas
Cinco meses en modo YOLO sin un accidente, y aun así sin confiar: snapshots de BTRFS, backups con restic, un sandbox y disciplina.
Experimentos y herramientas
Cosas que construí o probé, incluidas las que no funcionaron.
Desafío de IA: convertir ROMs de NES a Master System
Modelos de frontera frente a la traducción de 6502 a Z80, con el emulador como oráculo de feedback, y el punto donde los mappers lo traban todo.
Usando IA para resolver mis pequeños problemas del día a día
Un reloj de escritorio con widgets, lectores de manga, correo, práctica de mecanografía, karaoke: herramientas pequeñas nacidas de molestias pequeñas.
ai-memory 2.0
El formato abierto OKF, embeddings locales por defecto y equipos trabajando en paralelo, comparado con las alternativas.
Vibe code: de cero a producción en 6 días
Cómo la newsletter, el blog, el podcast y el bot de Discord de The M.Akita Chronicles salieron a producción en seis días y 201 commits.
Opiniones
Donde le discuto al hype. Espera palabras fuertes.
Prefiero pedir perdón que pedir permiso.
Opinión polémica: harness, loop y graph engineering son puro humo
Treinta repositorios públicos, un benchmark y un maratón de IA, y ninguno necesitó una disciplina nueva con precio de consultoría.
Desahogo: ¿la IA mató a los programadores?
Por qué la IA no va a reemplazar a los programadores con experiencia, el techo de la curva S de los LLMs actuales y qué cambia para los ingenieros.
Todo lo que hay aquí es código abierto
Las herramientas, las skills y el benchmark son repositorios públicos. Haz un fork y arma la versión que encaje con tu forma de trabajar.