Infraestrutura & Cloud
AIOps: inteligência artificial aplicada à operação de infraestrutura
Entenda como AIOps aplica inteligência artificial às operações de TI para correlacionar eventos, detectar anomalias, reduzir ruído, analisar logs, prever capacidade e apoiar a investigação de incidentes.
Por Thiago Henrique ·
Uma operação de infraestrutura moderna pode gerar milhares de sinais por dia.
Métricas de CPU, memória, disco e rede. Logs de sistemas, aplicações e firewalls. Eventos de cloud, hypervisors, containers, bancos de dados e ferramentas de monitoramento.
O desafio deixa de ser apenas coletar dados.
Passa a ser entender quais sinais realmente importam, quais estão relacionados e qual deles representa a causa — e não apenas a consequência — de um problema.
É nesse ponto que entra AIOps.
A IBM define AIOps como a aplicação de inteligência artificial, machine learning e análise de dados às operações de TI para automatizar, simplificar e otimizar fluxos operacionais. A Red Hat também relaciona o conceito à análise de grandes volumes de dados operacionais em tempo real.
Na prática, AIOps tenta responder perguntas como:
esses 300 alertas representam 300 problemas ou apenas um incidente?
esse aumento de latência é normal ou representa uma anomalia?
qual mudança ocorreu antes da degradação?
quais componentes possuem dependência entre si?
qual recurso tende a atingir seu limite nas próximas semanas?
AIOps não substitui monitoramento, observabilidade ou operação.
Ele adiciona uma camada de análise sobre esses dados.
AIOps começa pelos dados operacionais
Não existe AIOps sem telemetria.
Antes que um modelo consiga detectar anomalias ou correlacionar eventos, a operação precisa possuir dados suficientes e minimamente organizados.
Esses dados podem vir de:
métricas;
logs;
traces;
eventos;
alertas;
inventário;
topologia;
tickets;
histórico de mudanças;
dados de capacidade.
Imagine um usuário relatando lentidão.
O monitoramento mostra CPU normal.
O banco apresenta aumento de latência.
Um switch registra perda de pacotes.
O hypervisor mostra storage congestionado.
Uma mudança foi aplicada quarenta minutos antes.
Cada informação isolada conta apenas parte da história.
AIOps tenta trabalhar justamente na correlação entre esses sinais.
Correlação de eventos reduz ruído
Um dos usos mais conhecidos de AIOps é event correlation.
Imagine que um switch de distribuição fique indisponível.
Como consequência:
access points deixam de responder;
servidores perdem conectividade;
aplicações geram erros;
verificações HTTP falham;
dezenas de alertas são disparados.
Sem correlação, a equipe recebe vários eventos independentes.
Mas pode existir apenas uma causa principal.
Uma plataforma que conhece topologia, dependências e proximidade temporal pode agrupar esses eventos em um incidente mais significativo:
possível falha no switch de distribuição afetando múltiplos componentes dependentes.
Essa redução de ruído é uma das aplicações mais relevantes de AIOps.
Redução de ruído não significa esconder informação
Uma boa correlação não deveria simplesmente descartar eventos.
Ela deveria organizar.
O operador precisa conseguir visualizar:
incidente principal;
alertas relacionados;
componentes afetados;
dependências;
linha do tempo;
alterações recentes;
evidências usadas na correlação.
Isso preserva contexto e evita transformar AIOps em uma caixa-preta.
Detecção de anomalias vai além de thresholds
Monitoramento tradicional frequentemente utiliza limites fixos.
Por exemplo:
CPU > 90% por 5 minutos → alerta
Esse modelo continua útil.
Mas nem todo comportamento anormal ultrapassa um limite.
Se um servidor que normalmente utiliza 20% de CPU durante a madrugada passa a permanecer em 65%, talvez nenhum threshold seja acionado.
Mesmo assim, o comportamento mudou.
Detecção de anomalias trabalha justamente com desvios em relação ao padrão esperado, considerando fatores como:
histórico;
sazonalidade;
horário;
tendência;
relação entre métricas;
comportamento de recursos semelhantes.
O Azure Monitor possui recursos baseados em machine learning para identificar comportamentos fora do padrão esperado.
A vantagem é adicionar contexto.
Um threshold pergunta:
o valor passou do limite?
Um baseline pergunta:
isso é normal para este recurso neste momento?
AIOps pode apoiar investigação de causa raiz
Depois de identificar um incidente, surge uma pergunta mais difícil:
por que isso aconteceu?
Normalmente, o operador precisa consultar dashboards, logs, eventos, topologia, mudanças recentes, cloud console e histórico da aplicação.
AIOps pode reduzir parte desse trabalho ao correlacionar essas evidências.
A documentação do Azure Copilot Observability Agent descreve investigações que coletam métricas, logs, traces, eventos e histórico de mudanças antes de apresentar descobertas e próximas etapas.
A lógica é interessante:
o que mudou → onde ocorreu → quais componentes foram afetados → quais sinais aparecem juntos → qual hipótese possui mais evidências
Mas “causa provável” continua sendo uma expressão importante.
Correlação não é automaticamente causalidade.
Análise de logs é uma das áreas mais úteis
Logs possuem grande quantidade de informação operacional.
Também possuem grande quantidade de ruído.
Em um incidente, IA pode ajudar a:
resumir conjuntos de logs;
identificar mensagens fora do padrão;
agrupar erros semelhantes;
encontrar eventos próximos ao horário do incidente;
correlacionar logs com métricas;
explicar mensagens técnicas.
Isso é particularmente útil quando diferentes componentes participam da mesma transação:
aplicação, proxy, API, banco, sistema operacional, cloud e rede.
A análise isolada de cada fonte pode consumir muito tempo.
AIOps e observabilidade trabalham juntos
AIOps não substitui observabilidade.
Ele depende dela.
Métricas mostram comportamento quantitativo.
Logs fornecem detalhes.
Traces ajudam a acompanhar transações e dependências.
Eventos registram mudanças.
Topologia mostra relações entre componentes.
Podemos imaginar o fluxo:
infraestrutura e aplicações → telemetria → observabilidade → análise por IA → incidente contextualizado → ação
Esse assunto se conecta diretamente ao artigo Monitoramento de infraestrutura de TI: arquitetura, métricas, protocolos e boas práticas.
Previsão de capacidade muda a operação
Outro uso importante de AIOps aparece em capacity planning.
Monitoramento mostra o estado atual.
Histórico mostra tendência.
Imagine um filesystem crescendo aproximadamente 2% por semana.
Hoje ainda existem 30% de espaço livre.
Não existe incidente.
Mas existe uma tendência.
Análise preditiva pode estimar quando aquele recurso deverá atingir determinado limite.
O mesmo raciocínio pode ser aplicado a:
armazenamento;
memória;
links;
IOPS;
clusters;
bancos;
consumo de cloud.
A IBM inclui previsão de demanda e capacidade entre os usos associados a AIOps.
Isso permite sair de:
“o disco está cheio”
para:
“mantido o padrão atual, esse volume deverá atingir 85% em aproximadamente três semanas.”
De alerta para incidente contextualizado
Um alerta isolado pode dizer:
CPU acima de 95%.
Um incidente enriquecido pode apresentar:
Servidor: APP-PROD-03 Início: 14:37 Mudança recente: deployment 14:31 Anomalia: aumento de CPU e latência após deployment Logs relacionados: aumento de timeout Impacto: degradação do serviço Hipótese: regressão após mudança recente
A diferença é enorme.
O operador começa a investigação com contexto, não apenas com um número.
AIOps também pode sugerir ações
Depois de identificar e contextualizar um incidente, existe outra pergunta:
o que fazer?
A plataforma pode consultar:
runbooks;
histórico de incidentes;
documentação;
tickets resolvidos;
base de conhecimento.
Com isso, pode sugerir ações como:
reiniciar serviço
aumentar capacidade
validar conexão com banco
reverter uma implantação
executar diagnóstico
Mas existe uma diferença importante entre recomendar e executar.
Human-in-the-loop continua importante
Uma IA pode recomendar uma ação correta.
Isso não significa que deveria executá-la automaticamente em produção.
Podemos imaginar diferentes níveis de autonomia:
análise → recomendação → preparação → execução com aprovação → execução autônoma
Quanto maior a autonomia, maior precisa ser o nível de controle.
Infraestrutura possui efeitos reais.
Uma decisão errada pode:
remover recursos;
interromper aplicações;
modificar firewall;
aumentar custos;
afetar dados.
Por isso, ambientes críticos tendem a manter aprovação humana em operações de maior risco.
A IA acelera investigação e preparação.
O operador mantém o controle.
AIOps e automação são coisas diferentes
AIOps identifica e contextualiza.
Automação executa.
Por exemplo:
AIOps: identifica que vários servidores apresentam o mesmo problema após uma alteração.
Automação: executa um runbook para corrigir a configuração.
As duas camadas podem trabalhar juntas:
monitoramento → correlação → incidente → análise → recomendação → aprovação → automação → validação
A automação pode utilizar Ansible, scripts, APIs ou pipelines.
Isso conecta AIOps ao tema de automação de infraestrutura e Infrastructure as Code.
O papel dos runbooks
Runbook é um procedimento operacional documentado.
Por exemplo:
Alerta: filesystem acima de 90%
verificar crescimento;
identificar diretórios;
validar logs;
revisar retenção;
avaliar expansão;
confirmar normalização.
Uma IA pode localizar esse procedimento e usá-lo como fonte de contexto.
Isso é mais seguro do que simplesmente inventar uma ação.
Também ajuda a transformar conhecimento informal em processo operacional.
AIOps no NOC
Um NOC pode acompanhar:
links;
switches;
firewalls;
servidores;
aplicações;
cloud;
backup;
segurança.
Quando centenas de alertas surgem após uma falha, uma camada AIOps pode:
receber alertas → identificar dependências → agrupar eventos → detectar anomalias → sugerir causa provável → apresentar evidências → recomendar runbook
Esse é um dos usos mais claros da tecnologia.
Ela não elimina o operador.
Reduz o tempo gasto reunindo informações dispersas.
Dados ruins produzem análises ruins
AIOps não resolve automaticamente uma operação desorganizada.
Alguns problemas comuns:
ativos sem identificação consistente;
métricas ausentes;
logs sem contexto;
alertas mal configurados;
inventário desatualizado;
dependências desconhecidas;
falta de histórico;
ausência de documentação.
Antes de pensar em IA, é importante organizar a base operacional.
Monitoramento, observabilidade e gestão de configuração continuam fundamentais.
Topologia melhora a correlação
Saber que dois alertas ocorreram ao mesmo tempo ajuda.
Saber que um componente depende do outro ajuda muito mais.
Topologia pode representar relações como:
Aplicação → API → Banco
Servidor → Hypervisor → Storage
Access Point → Switch → Firewall → Internet
Quando a plataforma conhece essas dependências, a correlação se torna mais significativa.
Uma falha no storage pode explicar alertas em várias VMs.
Uma falha de DNS pode afetar aplicações aparentemente independentes.
Contexto arquitetural é tão importante quanto telemetria.
IA generativa adiciona uma nova camada
Durante muito tempo, AIOps esteve associado principalmente a machine learning aplicado a séries temporais, correlação e detecção de anomalias.
Modelos generativos adicionaram novas possibilidades.
Eles podem ajudar a:
resumir incidentes;
explicar logs;
consultar dados em linguagem natural;
gerar queries;
relacionar documentação;
sugerir hipóteses;
pesquisar runbooks.
A Microsoft diferencia recursos tradicionais de AIOps, voltados a padrões e anomalias, de operações agentic, voltadas à investigação e acompanhamento orientado.
Machine learning e IA generativa não fazem exatamente a mesma coisa.
Podem trabalhar juntas.
AIOps não significa substituir a equipe de operações
Infraestrutura possui contexto, arquitetura, histórico, risco, políticas e prioridades.
Uma IA pode analisar grande quantidade de dados rapidamente.
Mas isso não significa que possua todo o contexto necessário para decidir.
O valor está em aumentar a capacidade do operador.
Menos tempo procurando.
Mais tempo analisando.
Menos alertas repetidos.
Mais contexto.
Menos investigação manual.
Mais evidências organizadas.
O caminho mais realista começa com assistência
Uma adoção controlada pode evoluir gradualmente:
resumo de alertas e logs
→ correlação e agrupamento
→ detecção de anomalias
→ recomendação de causa provável
→ sugestão de runbook
→ execução com aprovação humana
→ automação autônoma apenas em cenários de baixo risco
Esse modelo permite aumentar confiança progressivamente.
AIOps conecta observabilidade, automação e inteligência artificial
AIOps não é apenas colocar um chatbot sobre dashboards.
O valor aparece quando diferentes camadas trabalham juntas.
Telemetria fornece evidências.
Observabilidade organiza sinais.
Machine learning identifica padrões e anomalias.
Correlação transforma eventos em contexto.
IA generativa ajuda na investigação e explicação.
Automação executa ações.
Governança define até onde o sistema pode agir.
À medida que ambientes se tornam mais distribuídos e geram mais telemetria, analisar tudo manualmente se torna cada vez menos viável.
AIOps adiciona uma camada de inteligência para ajudar a separar sinal de ruído, identificar padrões, correlacionar eventos e acelerar investigações.
O melhor resultado não vem de entregar controle irrestrito à IA.
Vem de combinar dados confiáveis, observabilidade, automação, contexto operacional e decisão humana.
