
Teste de Fluxos de Trabalho do Seu Agente de IA: A Solução para Reduzir Custos
Seu agente executa o mesmo loop "puxar as métricas, verificar o deploy, escrever o relatório" em uma programação. Cada execução, o modelo re-deriva essas etapas do zero — a um custo total de tokens, sem garantia de que faz a mesma coisa duas vezes.
Você nunca enviaria uma UI assim. Você a testa com snapshots. Os fluxos de trabalho do seu agente não têm equivalente. 🫠
Essa é a lacuna que o Reelier (github.com/seldonframe/reelier) preenche: grave uma execução bem-sucedida uma vez, compile-a em um SKILL.md, reproduza-a de forma determinística a 0 tokens e compare execuções para detectar desvios — com um código de saída que seu CI entende.
Os números primeiro, porque você deve exigí-los
Do benchmark publicado no repositório:
- 1.000/1.000 reproduções idênticas em bytes
- 0 tokens por reprodução (verificado a partir dos registros de execução — não há modelo no loop para cobrar)
- **48ms vs 2.842ms **contra o agente fazendo o mesmo trabalho
E os limites, declarados de forma bem clara:
- A reprodução lida o núcleo determinístico; os passos de julgamento ainda precisam de um modelo
- Somente leitura por padrão — gravações nunca são reativadas sem --allow-writes
Aqui está o que uma reprodução realmente devolve:
`▶ nightly-deploy-check (nível 0, somente leitura)
1. github.get_latest_deployment .... ok 4/4 asserts 31ms
2. http.get ........................ ok 3/3 asserts 17ms
PASS 2 passos · 7/7 asserts · 0 tokens · 48ms
recibo: .reelier/runs/2026-07-21T06-00-12Z.json`
Um recibo 🧾, não uma sensação. Vamos construir um. Todos os comandos funcionam como estão no PowerShell e bash — um comando por linha, sem &&.
Passo 1 — Instalar e inicializar
npm i -g reelier
reelier init
reelier init procura o histórico da sessão do agente já no seu computador — Claude Code, Codex, Windsurf e OpenClaw todos gravam sessões no disco — e oferece levantar um fluxo de trabalho reproduzível a partir do trabalho que você já pagou.
Sem chave de API, sem cadastro. Tudo roda e permanece local.
Quer gravar algo novo? Envolva qualquer servidor MCP no proxy de gravação do Reelier e use seu agente normalmente:
reelier mcp --wrap "npx -y @your/mcp-server"
Cada chamada e resultado de ferramenta que flui pelo proxy é capturado. Ou converta uma sessão passada específica diretamente:
reelier from-session
reelier scan
Passo 2 — Como é um SKILL.md compilado
A compilação faz zero chamadas LLM — é uma transformação determinística a partir da gravação. Aqui está a forma (reduzida de uma gravação real; seus nomes de campo serão diferentes):
# Skill: nightly-deploy-check
Gravado de: sessão claude-code 2026-07-14
Nível de reprodução: 0 (determinístico, somente leitura)
## Passos
### 1. github.get_latest_deployment
args: { "repo": "acme/storefront", "env": "production" }
assert:
- status: ok
- type: result.sha == string
- regex: result.sha ~ ^[0-9a-f]{40}$
- contains: result.state in ["active"]
### 2. http.get
args: { "url": "https://storefront.acme.com/api/health" }
assert:
- status: ok
- range: result.latency_ms in 0..2000
- contains: result.body has "\"db\":\"up\""
## Questões em aberto
- Passo 1 `result.created_at` é um timestamp — excluído da comparação de bytes. Confirme que isso é intencional.
Duas escolhas de design que vale a pena notar
1.A gramática de asserção é pequena de propósito. Cinco verificações — status, tipo, regex, intervalo, contém. Elas sobrevivem à variação esperada (um timestamp fresco não falha em uma verificação de tipo) mas capturam mudanças estruturais: um campo renomeado, um erro de autenticação, HTML onde antes era JSON.
Asserções, não sensações. Sem similaridade de incorporação, sem limiares de "próximo o suficiente".
- O compilador não adivinha. Valores que não pode provar estáveis — datas, UUIDs, cursores — vão para uma honesta seção ## Questões em aberto para você resolver, em vez de serem silenciosamente incorporados e quebrar a reprodução #2.
Passo 3 — Reproduza-o
reelier run nightly-deploy-check.skill.md
Isso imprime o recibo que você viu acima. Os 0 tokens não são uma estimativa — nenhum modelo foi executado.
Uma coisa mais naquele recibo: se um passo tivesse gravado uma gravação (um POST, uma ferramenta create_*), ele seria pulado com um aviso, a menos que você passasse --allow-writes. Essa configuração padrão existe porque reativar uma gravação gravada contra um mundo alterado é o único erro que esta ferramenta se recusa a cometer por você.
Passo 4 — reelier diff como um portão CI
diff compara execuções passo a passo, relata IGUAL ou DESVIADO, e sai 1 em caso de desvio. Esse código de saída é todo o truque para CI:
reelier run nightly-deploy-check.skill.md
reelier diff nightly-deploy-check
nightly-deploy-check: 2026-07-20 → 2026-07-21
1. github.get_latest_deployment .. IGUAL
2. http.get ...................... DESVIADO
assert failed: contains result.body has "\"db\":\"up\""
got: {"db":"degraded", ...}
exit 1
Quando algo desvia, o Reelier propõe — ele nunca se auto-corrige. Um teste que se corrige silenciosamente não é um teste.
Conecte ao GitHub Actions
Fluxo de trabalho mínimo (também há uma ação publicada no repositório se você preferir usar: em vez de gerenciar a instalação):
name: agent-drift-check
on:
schedule:
- cron: "0 6 * * *"
workflow_dispatch:
jobs:
replay:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v4
- uses: actions/setup-node@v4
with:
node-version: 20
- run: npm i -g reelier
- run: reelier run skills/nightly-deploy-check.skill.md
- run:Com a crescente adoção de agentes de IA, a eficiência na execução de tarefas se torna crucial. O Reelier oferece uma solução prática para empresas brasileiras, permitindo que elas otimizem custos e melhorem a confiabilidade de seus processos automatizados. Isso pode resultar em uma vantagem competitiva significativa no mercado.
Noticias relacionadas

Como Reduzir o Uso de Tokens em LLMs: 5 Táticas Comprovadas
Este guia explora cinco táticas para otimizar o uso de tokens em aplicações de IA, incluindo como o Bifrost pode ajudar a gerenciar e reduzir custos, melhorando a eficiência e a experiência do usuário.

Propriedade de tópicos do ChatGPT é rara, e SEO sozinho não explica
A análise da Semrush revela que apenas 15,2% das categorias do ChatGPT têm um proprietário de marca claro, destacando a instabilidade da autoridade de marca na busca por IA.

De Um Agente para Três: Dividindo um ChatClient Genérico em Agentes de IA Especializados
O artigo discute como dividir um assistente de IA em agentes especializados melhora a eficiência e a precisão nas respostas, evitando problemas de atenção e contexto compartilhado.
Gostou do conteudo?
Receba toda semana as principais novidades sobre WebMCP.