Pular para o conteúdo
Menu
WorkflowSkills, tmux e o ciclo do dia a diaFerramentasai-usagebarCota e horário de reset de 24 provedores de IAghpendingTodo PR e issue aberto numa lista sótclockUm relógio de terminal com widgets de comandoai-memoryMemória de longo prazo pra agentes de códigoai-jailUm sandbox de sistema pra agentes de código com IATextosO blog e o benchmark de LLMsNewsletterThe M.Akita Chronicles, toda segundaPodcastsConversas longas sobre IA, em vídeoGamesMinha coleção de games como código, no OmarchySetupOmarchy, tmux e o que eu deixei de ladoMe siga
Textos

Tudo que eu aprendo sobre IA, por escrito

Eu tenho blog desde 2006. Hoje a maior parte é sobre trabalhar com LLMs: o que funciona, quanto custa e o que é marketing. Todo post sai em português e em inglês.

LLM Benchmark v4

Todos os grandes modelos, testados no mesmo app sabotado

A versão 4 é um único app Rails que cresce ao longo de sete sprints enquanto um subagente isolado planta catorze sabotagens baseadas em CVEs reais. Os modelos são ranqueados por vigilância: perceberam o que estava quebrado e consertaram? Eu refiz o benchmark do zero pela terceira vez pra chegar nisso.

Quando sai um grande modelo de fronteira, ele passa pela mesma tabela. A última rodada adicionou 5 modelos em 23 de setembro de 2026. É assim que eu escolho qual modelo usar pra quê, e quanto cada um custa por tarefa.

44
modelos ranqueados
14
sabotagens pra pegar
7
sprints por rodada
$4.000+
gastos em 9 dias
Gráfico de bolhas dos resultados da v4: custo em dólares num eixo horizontal logarítmico contra a nota, o tamanho da bolha é o tempo de execução e a cor é o harness. Os melhores custo-benefício ficam no alto e à esquerda.
Custo contra nota dos modelos Tier A com custo real em dólares, da Parte 2. Mais alto e mais à esquerda é melhor; bolhas menores terminaram mais rápido.

Tudo aqui é open source

As ferramentas, as skills e o benchmark são repositórios públicos. Faça um fork e monte a versão que encaixa no seu jeito de trabalhar.