Eu medi o quanto meu agente de codificação realmente sabe sobre minha pilha. Foi 40%.
Meu agente de codificação responde a cada pergunta sobre minha pilha com total confiança. No mês passado, finalmente fiz a pergunta que deveria ter sido a primeira: quão verdadeiro é isso?
O experimento
Eu peguei a documentação da plataforma na qual meus agentes dependem diariamente — a API RGS de uma plataforma de jogos, seu SDK matemático, a lista de verificação de aprovação — anotei o que um agente deveria ser capaz de responder, gerei ~30 perguntas de controle a partir disso e classifiquei as respostas do agente em relação à documentação real.
Ele obteve cerca de 40%. A pior parte não foi a pontuação — foi que cada resposta errada soava exatamente como cada resposta certa. Mesma confiança, mesma fluência, mesmos blocos de código. Os dados de treinamento do modelo eram simplesmente mais antigos do que a documentação, e nada na conversa poderia me dizer quais respostas eram de 2024.
Arquivos de contexto não resolvem isso
A solução padrão é um CLAUDE.md / pasta de habilidades / um servidor MCP de memória. Eu tinha os três. Três problemas sobreviveram:
- Você paga por cada palavra, cada sessão — o arquivo inteiro acompanha, independentemente de o trabalho precisar ou não.
- Eles apodrecem silenciosamente. Um arquivo escrito em março está confiantemente errado em junho, e nada te avisa.
- Você não pode medi-los. Ninguém sabe o que uma pasta de markdown realmente cobre até que o agente falhe em produção.
Então eu fiz o conhecimento fazer um exame
Eu construí mozg em torno de um mecanismo: cada base de conhecimento ('cérebro') é pontuada de acordo com seu próprio propósito.
- Cole uma URL de documentação. O crawler encontra cada página (árvore do GitHub, llms.txt, sitemap ou uma caminhada de links) e extrai para notas atômicas e pesquisáveis.
- O objetivo que você escreveu se torna ~30 perguntas de exame. O cérebro as responde após cada ingestão. 'Treinado 87%' é um número medido, e as perguntas não respondidas são listadas diretamente na página do cérebro.
- O exame pergunta deliberadamente sobre coisas que o cérebro AINDA NÃO cobre. As falhas são o ponto — elas te dizem exatamente o que alimentar a seguir.
Agentes se conectam via MCP (um comando no Claude Code / Codex / Cursor) e buscam no servidor — o custo de contexto de uma resposta são as três notas que realmente precisavam, não as 700 que o cérebro possui.
A parte que eu não planejei: ele aprende com o uso
Uma vez que agentes reais estavam consultando cérebros, os logs continham algo melhor do que qualquer teste que eu pudesse escrever: as perguntas que o cérebro falhou em responder. Agora, cada busca que não retorna nada se torna uma pergunta de exame automaticamente, e a próxima re-leitura das fontes vai à caça disso. Os agentes de correção se tornam notas revisadas pelo proprietário. O décimo usuário obtém um cérebro mensuravelmente melhor do que o primeiro.
Esse mesmo exame acabou se tornando um currículo: learn.mozg.sh serve qualquer cérebro como um curso de repetição espaçada — ler, recordar, quiz — com o exame do cérebro como o final. O placar mostra sua porcentagem ao lado da do seu agente. Superar seu próprio agente é estranhamente motivador.
Limitações honestas
- O juiz é um modelo, então as pontuações oscilam ±3-4 pontos (a votação da maioria doma a maior parte disso).
- Um cérebro é tão bom quanto suas fontes — o exame te diz que material está faltando, não onde encontrá-lo.
- Para conhecimento estável e bem conhecido (Python stdlib), um cérebro não acrescenta nada — os modelos já o conhecem. Cérebros ganham seu sustento onde a documentação se move mais rápido do que os limites de treinamento.
E agora é código aberto
Todo o produto está no GitHub sob AGPL: https://github.com/egorfedorov/mozg — hospede você mesmo com suas próprias chaves e tudo funciona. Todo o catálogo oficial é gratuito. A nuvem ganha de uma maneira honesta: os planos cobrem a inferência que nossos servidores gastam construindo seus cérebros — ou você traz sua própria chave de API e não paga ninguém.
Experimente
O catálogo tem cérebros gratuitos, sem cartão, exatamente para aquelas pilhas de rápido movimento: Next.js App Router, Expo/React Native, Svelte 5, Tailwind v4, a própria especificação MCP. Conecte um ao seu agente em um minuto: https://mozg.sh — ou estude um você mesmo em https://learn.mozg.sh. Está em beta; o botão de chat dentro vai direto para mim.
O artigo destaca a importância de medir a eficácia dos agentes de IA em ambientes de desenvolvimento. Para empresas brasileiras, isso pode significar a necessidade de implementar sistemas de avaliação e correção para garantir que seus agentes de IA estejam atualizados e precisos.

