
Construindo um Agente que Transforma Metadados do DataHub em DAGs do Airflow
Construí isso com meu colega para o "Construa com DataHub: O Hackathon do Agente" do DataHub. O hackathon já terminou, mas continuamos a desenvolvê-lo.
O problema
Se você está usando o DataHub, já possui linhagem, SLAs de frescor, tags de PII e termos de glossário disponíveis. Mas transformar isso em um DAG do Airflow ainda significa fazê-lo manualmente.
O que ele faz
Dê um nome de tabela e ele:
Percorre o gráfico de linhagem para trás para encontrar todas as dependências upstream
Lê tags (pii, daily_refresh) e termos de glossário (FreshnessSLA, EmptyLoad) em cada tabela
Mapeia sinais para tarefas, pii → tarefa de auditoria, FreshnessSLA → verificação de frescor
Ordena topologicamente e reduz o gráfico, então renderiza um DAG do Airflow 3 limpo e determinístico
Pode opcionalmente abrir um PR no GitHub com um resumo de linhagem
Como é construído
Dois modos: um modo agente, onde um LLM (Claude, ou qualquer modelo via OpenRouter) explora o gráfico do DataHub através do protocolo MCP e produz um plano, e um modo script que ignora completamente o LLM para uso em CI.
A decisão de design que eu adoraria receber feedback: o LLM nunca escreve código diretamente. Ele apenas produz um plano estruturado, e um renderizador determinístico separado transforma isso no código da tarefa real do Airflow. Pareceu ser o limite certo entre "agente útil" e "não deixar um LLM gerar código arbitrário que acaba agendado em produção."
Ainda áspero ao redor das bordas
Sem suporte para operadores dbt ou Spark ainda (apenas stubs de tarefas shell), sem detecção de desvio de esquema, e até agora foi testado principalmente contra o conjunto de dados de amostra do Taxi de NYC do DataHub.
Tente
GitHub: github.com/tdm291104/datahub-dag-generator
Devpost: devpost.com/software/datahub-dag-generator
Demonstração: youtube.com/watch?v=2f0uNNmSBfc
Feedback e contribuições são bem-vindos, e se você achar útil, uma estrela no repositório faz uma grande diferença!!!
A automação de processos de dados é crucial para empresas que lidam com grandes volumes de informações. A integração de agentes de IA pode otimizar a criação de fluxos de trabalho, economizando tempo e reduzindo erros. Isso é especialmente relevante para empresas brasileiras que buscam modernizar suas operações.

