Voltar as noticias
Construindo um Agente que Transforma Metadados do DataHub em DAGs do Airflow
Agentic SEOMediaEN

Construindo um Agente que Transforma Metadados do DataHub em DAGs do Airflow

Dev.to - MCP·26 de agosto de 2026

Construí isso com meu colega para o "Construa com DataHub: O Hackathon do Agente" do DataHub. O hackathon já terminou, mas continuamos a desenvolvê-lo.

O problema

Se você está usando o DataHub, já possui linhagem, SLAs de frescor, tags de PII e termos de glossário disponíveis. Mas transformar isso em um DAG do Airflow ainda significa fazê-lo manualmente.

O que ele faz

Dê um nome de tabela e ele:

Percorre o gráfico de linhagem para trás para encontrar todas as dependências upstream
Lê tags (pii, daily_refresh) e termos de glossário (FreshnessSLA, EmptyLoad) em cada tabela
Mapeia sinais para tarefas, pii → tarefa de auditoria, FreshnessSLA → verificação de frescor
Ordena topologicamente e reduz o gráfico, então renderiza um DAG do Airflow 3 limpo e determinístico
Pode opcionalmente abrir um PR no GitHub com um resumo de linhagem

Como é construído

Dois modos: um modo agente, onde um LLM (Claude, ou qualquer modelo via OpenRouter) explora o gráfico do DataHub através do protocolo MCP e produz um plano, e um modo script que ignora completamente o LLM para uso em CI.

A decisão de design que eu adoraria receber feedback: o LLM nunca escreve código diretamente. Ele apenas produz um plano estruturado, e um renderizador determinístico separado transforma isso no código da tarefa real do Airflow. Pareceu ser o limite certo entre "agente útil" e "não deixar um LLM gerar código arbitrário que acaba agendado em produção."

Ainda áspero ao redor das bordas

Sem suporte para operadores dbt ou Spark ainda (apenas stubs de tarefas shell), sem detecção de desvio de esquema, e até agora foi testado principalmente contra o conjunto de dados de amostra do Taxi de NYC do DataHub.

Tente

GitHub: github.com/tdm291104/datahub-dag-generator
Devpost: devpost.com/software/datahub-dag-generator
Demonstração: youtube.com/watch?v=2f0uNNmSBfc

Feedback e contribuições são bem-vindos, e se você achar útil, uma estrela no repositório faz uma grande diferença!!!

Contexto Triplo Up

A automação de processos de dados é crucial para empresas que lidam com grandes volumes de informações. A integração de agentes de IA pode otimizar a criação de fluxos de trabalho, economizando tempo e reduzindo erros. Isso é especialmente relevante para empresas brasileiras que buscam modernizar suas operações.

Noticias relacionadas

Gostou do conteudo?

Receba toda semana as principais novidades sobre WebMCP.