AIOps
A Inteligência Artificial não substitui decisões. Ela reduz incertezas.
O verdadeiro impacto da IA aparece antes da resolução do incidente
Ao longo da primeira série de artigos, procuramos compreender por que operações de TI cada vez mais sofisticadas continuam enfrentando dificuldades para responder rapidamente aos incidentes. Discutimos como o aumento da complexidade elevou o volume de informações disponíveis, mostramos que monitorar mais não significa compreender melhor, exploramos a importância da observabilidade como uma nova forma de operar e concluímos que reduzir o MTTR depende, antes de tudo, da velocidade com que conseguimos construir uma compreensão compartilhada do problema.
Na segunda série, deslocamos essa discussão para a Inteligência Artificial. Primeiro, argumentamos que agentes especializados, por si só, não resolvem os principais desafios das operações modernas, em “Os agentes de IA não resolvem o principal problema das operações de TI”. Em seguida, mostramos que qualquer agente depende de um contexto operacional compartilhado, em “Antes dos agentes, existe o contexto operacional”, que a especialização não substitui uma visão sistêmica, em “Um agente pode conhecer tudo sobre uma ferramenta. Ainda assim, não compreender o incidente.”, e que esse contexto representa um patrimônio exclusivo de cada organização, em “A próxima geração de AIOps será construída sobre plataformas de contexto operacional”.
Essa sequência nos conduz naturalmente a uma nova pergunta.
Se já compreendemos que agentes especializados dependem de um contexto operacional consistente, qual passa a ser, afinal, o verdadeiro papel da Inteligência Artificial dentro dessa arquitetura?
A resposta mais comum costuma ser que a IA servirá para automatizar tarefas, substituir atividades repetitivas ou até mesmo tomar decisões no lugar dos operadores. Todas essas aplicações são relevantes e certamente continuarão evoluindo. Entretanto, quando observamos a dinâmica de uma grande operação de TI durante um incidente crítico, percebemos que existe uma contribuição ainda mais importante.
A Inteligência Artificial reduz incertezas.
À primeira vista, essa afirmação pode parecer abstrata. Na prática, porém, ela ajuda a explicar por que algumas organizações conseguem diagnosticar e resolver incidentes significativamente mais rápido do que outras, mesmo utilizando ferramentas semelhantes e contando com equipes igualmente qualificadas.
Porque, antes de restaurar um serviço, toda operação precisa responder a uma pergunta muito simples: o que realmente está acontecendo?
É justamente nesse intervalo, entre o surgimento dos primeiros sinais e a construção de uma explicação confiável para o incidente, que a maior parte do tempo costuma ser consumida. E é nesta fase que a Inteligência Artificial pode produzir seu maior impacto.
O tempo do incidente é consumido pela incerteza
Sempre que um incidente importante acontece, existe uma tendência natural de imaginar que o relógio do MTTR está sendo consumido pela execução das ações técnicas necessárias para restaurar o serviço. Pensamos em reiniciar aplicações, reverter implantações, ampliar capacidade computacional ou substituir componentes defeituosos. Essas atividades, naturalmente, fazem parte do processo de recuperação.
Mas quem acompanha operações críticas sabe que elas raramente representam a etapa mais demorada. Muito antes da primeira ação corretiva ser executada, existe um período em que a organização ainda tenta compreender o problema que precisa resolver.
As equipes começam a reunir evidências. Diferentes ferramentas registram sintomas aparentemente desconexos. Especialistas em infraestrutura analisam servidores e recursos computacionais. Profissionais de observabilidade investigam métricas e traces. A equipe de banco de dados verifica consultas, bloqueios e filas de processamento. Redes procuram alterações de latência. O Service Desk acompanha o crescimento dos chamados. Paralelamente, gestores tentam estimar o impacto sobre o negócio.
Todas essas atividades têm um objetivo comum: reduzir a incerteza.
Cada nova evidência elimina algumas hipóteses e fortalece outras. Um alerta inicialmente considerado a causa principal transforma-se em consequência de outro evento. Uma mudança aparentemente irrelevante passa a ganhar importância quando relacionada a novas informações. Aos poucos, aquilo que parecia um conjunto desordenado de sintomas começa a formar uma narrativa coerente sobre o que realmente aconteceu.
Esse processo é muito mais do que uma simples investigação técnica, é um processo contínuo de redução de incerteza. E compreender isso talvez seja a maneira mais precisa de entender o verdadeiro papel que a Inteligência Artificial desempenhará nas operações modernas.
Toda investigação é um processo de eliminação de hipóteses
Existe uma característica presente em praticamente toda investigação operacional que raramente recebe a devida atenção.
Quando um incidente começa, ninguém possui todas as respostas. As equipes trabalham, inicialmente, com hipóteses.
Talvez o problema tenha sido provocado por uma alteração realizada poucas horas antes. Talvez esteja relacionado a uma degradação na infraestrutura. Pode ser consequência de uma indisponibilidade em um serviço externo, de um aumento inesperado de carga, de uma falha em um componente de rede ou até mesmo de uma combinação de pequenos eventos que, isoladamente, não representariam qualquer risco para a operação.
Nos primeiros minutos, todas essas possibilidades parecem igualmente plausíveis. À medida que novas evidências surgem, algumas delas deixam de fazer sentido.
Outras passam a explicar melhor o comportamento observado. O trabalho da operação consiste exatamente em reduzir, de forma contínua, o conjunto de hipóteses possíveis até que reste aquela que melhor representa a causa do incidente.
Essa percepção muda a forma como entendemos a própria atividade de diagnóstico. Investigar um incidente não significa apenas procurar respostas, mas significa sobretudo eliminar explicações incorretas.
Cada log analisado, cada métrica consultada, cada alteração revisada e cada relação identificada entre componentes da arquitetura contribui para reduzir o espaço de incerteza sobre o qual a operação precisa trabalhar.
Quando observamos esse processo dessa forma, percebemos que a qualidade do diagnóstico não depende apenas da experiência dos especialistas ou da quantidade de informações disponíveis.
Ela depende da velocidade com que conseguimos transformar evidências dispersas em conhecimento confiável. É exatamente nesse ponto que a Inteligência Artificial começa a produzir um impacto diferente daquele normalmente associado à automação.
O verdadeiro papel da IA é acelerar a compreensão
Grande parte das discussões sobre Inteligência Artificial nas operações concentra-se na automação de tarefas. Fala-se em agentes capazes de abrir chamados, executar playbooks, realizar procedimentos de recuperação ou acionar equipes automaticamente. Todas essas aplicações possuem enorme valor e continuarão evoluindo.
Entretanto, antes que qualquer uma dessas ações aconteça, existe uma decisão muito mais importante: a operação precisa compreender o incidente.
Sem essa compreensão, qualquer automação corre o risco de agir sobre sintomas em vez de atuar sobre a causa do problema.
É justamente por isso que a principal contribuição da Inteligência Artificial não está, necessariamente, na execução das ações corretivas, mas sim na capacidade de acelerar a construção dessa compreensão.
Ao correlacionar eventos provenientes de múltiplas fontes, recuperar contexto operacional, identificar padrões recorrentes, estabelecer relações entre mudanças recentes e comportamentos observados, destacar evidências relevantes e eliminar hipóteses menos prováveis, a IA reduz significativamente o esforço cognitivo exigido das equipes.
A Inteligência Artificial não elimina a necessidade de investigação, ela torna a investigação mais eficiente, ou seja, não substitui a experiência dos especialistas, mas potencializa essa experiência. Não toma decisões isoladamente, mas cria melhores condições para que decisões sejam tomadas com maior segurança e em menos tempo.
Essa diferença talvez pareça apenas semântica, mas possui consequências profundas para a arquitetura das operações modernas.
Quanto menor o tempo necessário para reduzir a incerteza, mais rapidamente a organização identifica a causa provável do incidente. Quanto mais cedo essa compreensão é construída, mais cedo as ações corretivas podem ser iniciadas.
É por isso que, em muitas situações, o maior ganho proporcionado pela Inteligência Artificial acontece antes mesmo da primeira intervenção técnica.
A IA não reduz diretamente o MTTR, mas reduz o tempo necessário para compreender o incidente, e assim o MTTR diminui como consequência.
Essa relação explica por que organizações que utilizam Inteligência Artificial de forma mais madura não necessariamente automatizam mais procedimentos do que as demais. Elas simplesmente conseguem transformar informação em entendimento com muito mais rapidez.
É justamente essa capacidade que diferencia uma operação que reage aos sintomas de outra que compreende rapidamente a dinâmica do incidente e direciona seus esforços para aquilo que realmente precisa ser resolvido.
Menos incerteza significa menos tempo para resolver incidentes
Ao longo dos últimos anos, tornou-se comum associar o sucesso da Inteligência Artificial à sua capacidade de automatizar tarefas. Essa percepção não está errada. De fato, veremos agentes cada vez mais preparados para executar atividades operacionais, apoiar processos, interagir com sistemas e acelerar inúmeras rotinas que hoje ainda dependem de intervenção humana.
Entretanto, quando observamos como grandes incidentes realmente são conduzidos, percebemos que o maior valor da Inteligência Artificial aparece antes mesmo da automação, e aparece no momento em que a operação precisa compreender o problema. Foi exatamente essa ideia que procuramos desenvolver ao longo deste artigo.
Toda investigação começa cercada por incertezas. Diversas hipóteses competem entre si, diferentes equipes analisam perspectivas complementares do ambiente e novas evidências surgem continuamente. Cada informação relevante reduz parte dessa incerteza até que a organização consiga construir uma explicação suficientemente consistente para orientar a tomada de decisão. É justamente nesse processo que a Inteligência Artificial demonstra seu maior potencial.
Ao relacionar informações provenientes de múltiplas fontes, recuperar contexto operacional, identificar padrões e apresentar evidências relevantes, ela reduz significativamente o tempo necessário para transformar dados dispersos em compreensão compartilhada.
Essa talvez seja uma das mudanças mais importantes na forma de enxergar a IA aplicada às operações.
Durante muito tempo imaginamos que seu principal objetivo seria substituir operadores ou executar procedimentos automaticamente. Hoje começamos a perceber que sua maior contribuição está em permitir que pessoas e agentes compreendam mais rapidamente aquilo que está acontecendo.
Quando essa compreensão acontece mais cedo, toda a sequência de resposta ao incidente se torna mais eficiente. A equipe escolhe com maior precisão quais hipóteses investigar, direciona melhor seus esforços, evita ações desnecessárias e inicia a recuperação técnica muito antes do que ocorreria em um cenário de elevada incerteza.
É por isso que reduzir incertezas e reduzir o MTTR fazem parte do mesmo processo, e não é porque a Inteligência Artificial execute diretamente a recuperação do serviço, mas porque ela reduz o tempo necessário para descobrir qual recuperação realmente deve ser executada.
Essa distinção parece sutil, mas na prática, redefine completamente o papel da IA dentro das operações modernas.
A inteligência da operação não será medida pela automação
Durante muitos anos, a maturidade das operações foi associada ao volume de monitoramento, ao número de dashboards, à quantidade de automações implementadas ou à velocidade de execução dos procedimentos técnicos. Todos esses elementos continuam importantes e continuarão evoluindo.
Mas eles já não parecem suficientes para explicar por que algumas organizações conseguem responder aos incidentes com muito mais eficiência do que outras.
Ao longo dos últimos artigos mostramos que agentes especializados dependem de contexto, que esse contexto precisa ser compartilhado, que ele representa um patrimônio exclusivo de cada organização e que plataformas de contexto passam a ocupar uma posição central na arquitetura das operações inteligentes.
Este artigo acrescenta uma última peça a esse raciocínio: a Inteligência Artificial produz valor porque reduz incertezas. E quanto menor a incerteza, menor tende a ser o tempo necessário para compreender o incidente, tomar decisões consistentes e iniciar a recuperação do serviço.
Talvez seja justamente por isso que a inteligência de uma operação não deva ser medida apenas pelo grau de automação que ela alcançou.
Ela deverá ser medida, cada vez mais, pela velocidade com que consegue transformar informações dispersas em compreensão compartilhada, porque, no fim, toda decisão operacional é uma resposta à incerteza, e toda redução consistente do MTTR começa muito antes da execução técnica, ou seja, começa no instante em que a operação passa a compreender, com confiança, aquilo que realmente está acontecendo.
Da visão à prática: ARGUS
Ao longo desta série de artigos, defendemos que a próxima geração das operações de TI não será definida apenas pela adoção de agentes de Inteligência Artificial cada vez mais especializados. O verdadeiro diferencial estará na capacidade das organizações de construir e manter um contexto operacional compartilhado, permitindo que pessoas e agentes trabalhem sobre a mesma compreensão da operação.
Essa foi exatamente a premissa adotada no desenvolvimento do ARGUS.
Em vez de concentrar esforços na criação de mais um agente especializado, o ARGUS foi concebido para resolver um problema anterior e mais fundamental: construir continuamente o contexto operacional da organização a partir da integração de múltiplas fontes de informação.
Para isso, integra-se às plataformas de monitoramento, observabilidade, ITSM, infraestrutura, nuvem e demais sistemas operacionais já existentes, consolidando eventos, preservando relações entre aplicações, serviços, componentes, mudanças e processos de negócio e transformando essas informações em uma representação consistente da realidade operacional.
É justamente esse contexto que permite reduzir o espaço de incerteza durante um incidente.
Quando operadores e agentes de Inteligência Artificial passam a trabalhar sobre a mesma compreensão do ambiente, a investigação torna-se mais rápida, hipóteses incorretas são descartadas mais cedo, a causa provável é identificada com maior precisão e as decisões passam a ser tomadas com mais segurança. Como consequência, o tempo necessário para diagnosticar e resolver incidentes tende a diminuir de forma significativa.
Sob essa perspectiva, o ARGUS não substitui as ferramentas já existentes nem compete com os agentes de IA que continuarão surgindo. Seu papel é fornecer a camada de contexto operacional compartilhado que potencializa todos esses investimentos e cria as condições para que pessoas e Inteligência Artificial atuem de forma coordenada.
Essa é a arquitetura que, na nossa visão, sustentará a próxima geração das operações inteligentes.
Conheça mais em ARGUS AIOps.
Sobre o autor
Paulo Florêncio de Menezes é cofundador da Target Solutions e atua há mais de 15 anos em projetos relacionados a infraestrutura, monitoramento, observabilidade, automação e operações de TI e Telecom.
É graduado em Processamento de Dados pela Universidade Federal do Amazonas (UFAM), possui MBA em Gestão Empresarial pela Fundação Dom Cabral (FDC) e Mestrado Profissional em Economia pela Fundação Getulio Vargas (FGV).
Em sua pesquisa de Mestrado, desenvolveu o IBEOP-IA (Índice Brasileiro de Exposição Ocupacional Potencial à Inteligência Artificial), investigando a exposição potencial das ocupações brasileiras às capacidades da IA por meio da combinação de dados ocupacionais, patentes de inteligência artificial e técnicas de processamento de linguagem natural.
Sobre a Target Solutions
A Target Solutions atua há mais de 15 anos apoiando organizações na evolução de suas operações de infraestrutura, monitoramento, observabilidade, automação e AIOps. Ao longo desse período, participou de projetos em ambientes complexos dos setores de Telecom, Tecnologia, Governo, Energia e grandes empresas, com foco no aumento da eficiência operacional e da confiabilidade dos serviços.
Como parte dessa experiência, desenvolveu o ARGUS, uma plataforma de AIOps que complementa as ferramentas já utilizadas pelas organizações e atua como uma camada de inteligência contextual sobre o ecossistema operacional existente.
O ARGUS integra informações provenientes de múltiplas fontes, correlacionando eventos, alarmes, dados de observabilidade, relacionamentos entre componentes, topologia, mudanças, histórico e outras evidências disponíveis no ambiente.
Essa abordagem permite que operadores, especialistas e agentes de Inteligência Artificial trabalhem sobre o mesmo contexto, reduzindo o esforço de investigação, acelerando a identificação da causa provável dos incidentes e apoiando decisões mais rápidas e seguras.
O objetivo não é substituir as ferramentas especializadas já utilizadas pela organização. É conectar as perspectivas produzidas por elas e transformar informações dispersas em contexto operacional compartilhado.
Conheça mais em ARGUS AIOps.