# Ingestão de dados para o mundo real

> Integre toda sua data stack, configure retries inteligentes e execute backfills personalizados por tabela e endpoints.

Source: https://www.erathos.com/control

## API aberta para integrar com o resto do seu stack

Integre a ingestão de dados ao resto do seu workflow. Dispare jobs no Databricks quando a ingestão terminar, orquestre com Airflow ou Dagster, e rode transformações dbt com os dados já prontos.

### Acione jobs via API

Dispare e gerencie pipelines de ingestão programaticamente, direto de qualquer sistema externo.

### Orquestre com suas ferramentas

Integre a ingestão a Airflow, Dagster ou qualquer orquestrador que já faça parte do seu stack.

### Coordene com o resto do pipeline

Encadeie a ingestão com transformações e automações downstream, como parte de um workflow maior.

## Configure o retry certo para cada API

Cada API se comporta de forma diferente. Alguns endpoints exigem retries agressivos. Outros precisam de janelas maiores de backoff.

A Erathos permite definir estratégias de retry tanto no nível da conexão quanto do job, garantindo que pipelines se recuperem de falhas sem sobrecarregar sistemas externos.

### Estratégias de retry personalizadas

Defina quantas vezes cada job tenta de novo depois antes de alertar como erro.

### Backoff configurável

Ajuste os intervalos entre tentativas para garantir o sucesso da execução.

### Retry por conexão ou por job

Aplique uma política padrão na conexão inteira e sobrescreva a lógica para jobs específicos quando precisar.

## Reprocesse dados históricos quando necessário

A Erathos permite ajustar cursores diretamente nas execuções dos jobs, facilitando o reprocessamento de intervalos específicos ou a recuperação de falhas parciais.

### Ajuste cursores nas execuções

Mude o ponto de partida de uma execução de job direto na run, sem alterar a configuração da pipeline.

### Reprocesse intervalos específicos

Reprocesse a partir de uma data específica, sem rodar a pipeline inteira de novo.

### Detecte deleções sem full refresh

Use o backfill para comparar com a fonte e marcar registros removidos como soft delete, sem recarregar a tabela inteira.

## Agende pipelines com precisão

A maioria das ferramentas de ingestão agenda pipelines no nível da fonte. Mas APIs raramente se comportam de forma uniforme.

A Erathos permite agendar por endpoint ou tabela, para que cada dataset sincronize na frequência que realmente precisa.

### Agendamento por endpoint ou tabela

Defina o agendamento no nível que faz sentido, não só na fonte inteira.

### Rode um endpoint específico quando quiser

Dispare a sincronização de um endpoint específico a qualquer momento, sem precisar atualizar a fonte inteira.

### Menos chamadas, dados mais frescos

Evite mover dados que não mudaram, reduza chamadas à API e mantenha os datasets críticos sempre atualizados.

## Dúvidas Frequentes

### O que significa ter controle sobre a ingestão de dados?

Significa poder decidir como cada pipeline se comporta, não só visualizar se os dados chegaram. Envolve disparar e orquestrar jobs via API, definir estratégias de retry por conexão ou job, reprocessar intervalos específicos do histórico sem recarregar tudo, e agendar por endpoint ou tabela em vez de por fonte inteira.

### Por que ter controle sobre a ingestão de dados é importante?

Porque ingestão sem controle vira caixa-preta. Você só descobre que algo deu errado quando o dado já chegou incompleto ou atrasado no destino. Com controle, você decide como cada pipeline reage a falhas, corrige histórico sem depender do time da ferramenta, e ajusta a frequência conforme a necessidade real de cada dataset.

### Como a Erathos me dá esse controle na prática?

Com API aberta pra disparar e orquestrar jobs, retries configuráveis por conexão ou job, backfill por cursor e agendamento por endpoint, em vez de deixar tudo na mão de um comportamento padrão fixo.

### Ter mais controle significa mais trabalho de configuração?

Não necessariamente. Os defaults da Erathos já cobrem a maioria dos casos. Você só mexe quando quer um comportamento diferente pra um endpoint ou job específico.

### Como eu acompanho isso no dia a dia, sem abrir a configuração toda hora?

Cada execução fica registrada com o que rodou, quando e com qual resultado, incluindo retries, falhas e reprocessamentos. É controle e observabilidade juntos.
