IA Agêntica
Antes dos agentes, existe o contexto operacional
Uma nova pergunta para uma nova fase das operações
Ao longo da série de artigos denominada de “Operações Modernas de TI”, procuramos compreender como a crescente complexidade dos ambientes tecnológicos transformou o trabalho das equipes de operações.
Começamos discutindo por que tantas organizações continuam apagando incêndios mesmo após anos de investimentos em novas tecnologias. Em seguida, refletimos sobre o paradoxo de monitorarmos praticamente tudo e, ainda assim, convivermos com um volume crescente de alertas.
Essa discussão nos levou naturalmente ao verdadeiro desafio das operações modernas:
Perceber que detectar um incidente costuma ser relativamente simples, mas construir o contexto necessário para identificar sua causa raiz continua sendo uma das atividades mais difíceis da operação.
A partir dessa constatação, mostramos que observabilidade deixou de ser apenas uma ferramenta para se tornar uma nova forma de operar e concluímos a primeira série demonstrando que reduzir o MTTR depende muito mais da velocidade com que compreendemos um incidente do que da velocidade com que executamos sua recuperação.
No primeiro artigo desta segunda série, voltamos nossa atenção para outro movimento que vem transformando rapidamente o mercado: a adoção crescente de agentes de Inteligência Artificial.
A principal reflexão proposta foi que esses agentes representam uma evolução importante, mas não resolvem, por si só, o principal desafio das operações modernas. Encerramos aquele artigo deixando uma pergunta em aberto.
Se cada agente conhece profundamente apenas uma parte da operação, como todos eles conseguirão construir uma compreensão comum quando um incidente envolver aplicações, infraestrutura, observabilidade, redes, serviços em nuvem e plataformas de ITSM ao mesmo tempo?
Responder a essa pergunta exige mudar novamente a perspectiva.
Nos últimos meses, o mercado concentrou grande parte de sua atenção na evolução dos modelos de linguagem, dos agentes especializados e das tarefas que eles poderão executar. Trata-se de uma discussão extremamente relevante. No entanto, existe um aspecto muito mais fundamental que costuma permanecer em segundo plano.
Antes que qualquer Inteligência Artificial consiga interpretar um incidente, recomendar uma ação ou executar uma automação, ela precisa compreender o contexto em que aquele incidente está acontecendo.
É justamente sobre esse contexto, e sobre o papel que ele desempenhará na próxima geração das operações de TI, que trata este artigo.
O contexto não nasce dentro do agente
A pergunta que encerramos na introdução pode parecer simples, mas ela muda completamente a forma como enxergamos a Inteligência Artificial aplicada às operações de TI.
Se agentes especializados dependem do contexto para interpretar um incidente, de onde esse contexto virá?
À primeira vista, a resposta parece óbvia. Muitos imaginam que ele será construído pelo próprio agente à medida que analisa logs, consulta métricas ou interpreta eventos produzidos pelas ferramentas da operação. Essa percepção é compreensível, principalmente porque as demonstrações de soluções baseadas em Inteligência Artificial costumam enfatizar justamente essa capacidade de análise.
Entretanto, quando observamos o funcionamento das operações em ambientes corporativos complexos, percebemos que essa expectativa dificilmente se sustenta.
Imagine uma organização que utiliza uma plataforma de observabilidade para acompanhar aplicações, uma ferramenta de monitoramento para infraestrutura, soluções específicas para redes, serviços em nuvem de diferentes provedores, um sistema de ITSM para gestão dos incidentes, além de uma CMDB e uma base de conhecimento construída ao longo dos anos.
Cada uma dessas plataformas possui uma visão legítima da operação. Cada uma registra eventos importantes. Cada uma produz informações que podem ser decisivas durante uma investigação.
O problema é que nenhuma delas conhece, isoladamente, toda a história.
Quando um incidente ocorre, as informações relevantes passam a existir simultaneamente em diversos lugares. Uma alteração registrada na plataforma de mudanças pode explicar uma degradação percebida pela observabilidade. Um aumento de latência observado nas aplicações pode estar relacionado a um comportamento registrado pela infraestrutura alguns minutos antes. Um chamado aberto pelo Service Desk pode representar apenas a consequência de um problema cuja origem está em um componente completamente diferente.
Essas relações dificilmente aparecem de forma explícita em uma única ferramenta.
Na prática, elas precisam ser construídas.
É exatamente esse trabalho que hoje realizam os profissionais mais experientes das operações. Ao investigar um incidente, eles não analisam apenas métricas, logs ou chamados. Eles procuram relacionar informações provenientes de diferentes plataformas, reconstruindo uma sequência lógica de acontecimentos até que o comportamento do ambiente comece a fazer sentido.
Essa atividade exige muito mais do que capacidade de interpretação, ou seja, ela exige contexto.
Perceba que essa constatação altera a própria forma como devemos compreender o papel dos agentes de Inteligência Artificial.
Eles não começam sua análise a partir de uma visão completa da operação. Eles começam a partir das informações que lhes foram disponibilizadas.
Quanto melhor for esse conjunto de informações, maior será a probabilidade de produzirem análises consistentes. Da mesma forma, quando esse contexto estiver incompleto, fragmentado ou distribuído entre diferentes plataformas sem qualquer relação explícita entre elas, mesmo agentes extremamente sofisticados encontrarão dificuldades para chegar às melhores conclusões.
Por isso, talvez a pergunta mais importante já não seja “quão inteligente é o agente?”. Talvez devêssemos perguntar “quão completo é o contexto que ele recebeu para trabalhar?”
A diferença entre informação e contexto
Essa distinção parece apenas uma questão de terminologia, mas possui consequências profundas para a arquitetura das operações de TI.
Durante muitos anos, investimos para aumentar nossa capacidade de produzir informações. Instrumentamos aplicações, ampliamos a coleta de métricas, centralizamos logs, implantamos plataformas de observabilidade e criamos mecanismos cada vez mais sofisticados para registrar o comportamento dos ambientes.
Hoje, poucas organizações sofrem pela ausência de dados, mas o desafio mudou.
Passamos a conviver com uma enorme quantidade de informações distribuídas entre dezenas de plataformas, cada uma organizada segundo sua própria lógica, seus próprios identificadores e sua própria visão da realidade operacional.
Informação, portanto, deixou de ser um recurso escasso. O recurso verdadeiramente escasso passou a ser a capacidade de conectar essas informações de forma coerente. É justamente essa conexão que transforma informação em contexto.
Considere, por exemplo, uma degradação percebida pelos usuários de um sistema de comércio eletrônico. Isoladamente, um aumento na utilização de CPU, uma alteração recente em um serviço de autenticação, um crescimento no tempo de resposta das APIs e um aumento no número de chamados registrados pelo Service Desk são apenas informações independentes. Cada uma descreve um aspecto do ambiente.
Quando conseguimos estabelecer as relações entre esses eventos, identificando sua sequência temporal, suas dependências e seus impactos sobre o negócio, deixamos de observar um conjunto de sintomas desconexos e passamos a compreender um único incidente.
Essa transformação não ocorre porque surgiram novos dados. Ela ocorre porque os dados existentes passaram a fazer sentido quando observados em conjunto.
É exatamente esse tipo de compreensão que qualquer agente de Inteligência Artificial precisará receber para produzir análises realmente úteis em operações modernas.
O contexto é construído, não encontrado
Existe uma ideia que aparece com frequência quando discutimos Inteligência Artificial aplicada às operações de TI. Muitos imaginam que o contexto operacional já existe e que basta permitir que um agente o consulte para obter respostas melhores.
Na prática, as operações modernas funcionam de maneira bastante diferente. O contexto raramente está pronto.
Na maioria das organizações, ele precisa ser construído continuamente a partir de informações produzidas por dezenas de plataformas independentes, cada uma registrando apenas uma parte do comportamento do ambiente. Métricas de infraestrutura, logs de aplicações, traces distribuídos, eventos de segurança, alterações registradas na gestão de mudanças, chamados do Service Desk, informações da CMDB, topologias de rede, dependências entre serviços e indicadores de negócio coexistem, mas normalmente permanecem armazenados em repositórios distintos e organizados segundo modelos completamente diferentes.
Individualmente, cada uma dessas fontes descreve apenas uma pequena parcela da realidade operacional.
O contexto surge quando essas informações passam a ser relacionadas entre si. Essa distinção pode parecer sutil, mas muda completamente a forma como devemos pensar a arquitetura das operações.
Considere uma empresa que acabou de receber centenas de alertas indicando degradação em diferentes aplicações críticas. Um agente especializado em observabilidade poderá identificar alterações importantes nos tempos de resposta. Outro agente, responsável pela infraestrutura, perceberá um aumento expressivo na utilização de determinados recursos computacionais. Um terceiro encontrará registros de erro nos logs de autenticação. Ao mesmo tempo, o ITSM mostrará um crescimento repentino no número de chamados, enquanto a plataforma responsável pelas mudanças registrará uma atualização realizada poucos minutos antes do início da degradação.
Nenhuma dessas informações explica o incidente por si só. A explicação começa a surgir quando conseguimos estabelecer as relações entre elas.
É nesse momento que os dados deixam de representar apenas eventos independentes e passam a formar uma narrativa coerente sobre o comportamento da operação.
Perceba que essa narrativa não estava armazenada em nenhuma ferramenta específica. Na verdade, ela precisou ser construída.
É justamente esse processo de construção que transforma um conjunto de informações dispersas em conhecimento operacional capaz de apoiar decisões.
Essa característica diferencia profundamente as operações de TI de outros cenários nos quais modelos de Inteligência Artificial também vêm sendo aplicados.
Operações não trabalham apenas com documentos. Trabalham com relações.
Quando pensamos em aplicações tradicionais de IA, é comum imaginarmos um agente consultando documentos, políticas internas, manuais técnicos ou bases de conhecimento para responder perguntas específicas. Nesses casos, a qualidade das respostas depende, em grande parte, da capacidade de recuperar os documentos mais relevantes e utilizá-los durante a geração da resposta.
Nas operações de TI, entretanto, o desafio costuma ser diferente.
O incidente que a equipe tenta compreender normalmente não está descrito em lugar algum. Ele está acontecendo naquele exato momento.
Mais do que recuperar informações existentes, a operação precisa reconstruir uma sequência de acontecimentos que ainda está se desenrolando. Isso exige correlacionar eventos produzidos em instantes diferentes, compreender dependências entre componentes, identificar relações de causa e efeito e distinguir sintomas daquilo que realmente deu origem ao problema.
Em outras palavras, o conhecimento que orientará a decisão ainda não existe de forma explícita. Ele precisa ser produzido.
Essa talvez seja uma das diferenças mais importantes entre utilizar Inteligência Artificial para responder perguntas sobre uma base de documentos e utilizá-la para apoiar operações críticas em tempo real. No primeiro caso, o principal desafio consiste em recuperar corretamente informações já organizadas. No segundo, o desafio passa a ser construir, continuamente, um contexto operacional capaz de representar a realidade dinâmica do ambiente.
É justamente por isso que o contexto não pode ser tratado como um detalhe da arquitetura.
Ele passa a ser a própria infraestrutura sobre a qual agentes, operadores e modelos de Inteligência Artificial conseguem construir uma compreensão comum do incidente.
O contexto passa a ser a infraestrutura da Inteligência Artificial
Ao longo dos últimos anos, acostumamo-nos a pensar nas operações de TI como um conjunto de ferramentas especializadas. Cada plataforma passou a desempenhar um papel específico, observando uma parte da infraestrutura, das aplicações ou dos serviços de negócio. Essa evolução trouxe ganhos importantes de visibilidade, automação e capacidade analítica, mas também tornou evidente um novo desafio: compreender ambientes distribuídos exige muito mais do que analisar informações produzidas por sistemas isolados.
A chegada dos agentes de Inteligência Artificial não altera essa realidade. Ao contrário, torna-a ainda mais evidente.
Quanto mais capazes esses agentes se tornam de interpretar informações e apoiar decisões, maior passa a ser a importância do contexto que lhes é disponibilizado. Afinal, a qualidade das conclusões continuará diretamente relacionada à qualidade da compreensão que conseguem construir sobre o ambiente operacional.
É justamente por isso que o contexto não deve ser visto como um recurso complementar da Inteligência Artificial. Ele passa a representar uma nova camada da arquitetura das operações modernas.
Essa camada é responsável por integrar informações provenientes de diferentes plataformas, estabelecer relações entre eventos, preservar dependências entre serviços e oferecer uma representação coerente da realidade operacional. É sobre ela que operadores, especialistas e agentes de Inteligência Artificial passam a construir suas análises, formular hipóteses e tomar decisões.
Quando observamos a evolução recente das operações sob essa perspectiva, percebemos que a discussão deixa de ser tecnológica e passa a ser arquitetural.
A questão mais importante já não é quantos agentes uma organização será capaz de desenvolver ou contratar.
A pergunta passa a ser outra.
Como garantir que todos eles trabalhem sobre a mesma compreensão da operação?
Essa mudança de foco altera profundamente a forma como devemos planejar o futuro das operações de TI. Em vez de imaginar um conjunto de inteligências independentes competindo para interpretar o mesmo incidente, começamos a visualizar um ambiente no qual diferentes agentes colaboram porque compartilham uma base comum de conhecimento sobre aquilo que está acontecendo.
Essa talvez seja a principal transformação que veremos nos próximos anos.
Não uma evolução baseada apenas em modelos cada vez mais sofisticados, mas na capacidade de construir e manter um contexto operacional compartilhado, suficientemente rico para permitir que pessoas e Inteligências Artificiais trabalhem sobre a mesma realidade.
O próximo desafio
Se o contexto operacional passa a ocupar essa posição central na arquitetura das operações, surge naturalmente uma nova pergunta.
Até aqui, discutimos por que agentes especializados dependem desse contexto para produzir análises consistentes e mostramos que ele não nasce espontaneamente dentro dos modelos de Inteligência Artificial. Também vimos que esse contexto precisa ser construído continuamente a partir da integração e da correlação de informações provenientes de múltiplas fontes.
Resta compreender como isso acontece na prática.
Como transformar dados distribuídos entre plataformas independentes em uma representação única e coerente da operação? Como preservar as relações entre aplicações, infraestrutura, serviços, mudanças e processos de negócio para que diferentes agentes possam trabalhar sobre a mesma compreensão do ambiente?
Essas perguntas nos conduzem ao próximo passo desta série.
No próximo artigo, discutiremos por que um agente especialista conhece profundamente uma ferramenta, mas continua incapaz de compreender sozinho um incidente que atravessa toda a arquitetura. Veremos que a especialização, embora indispensável, não elimina a necessidade de uma visão transversal da operação. Pelo contrário, quanto maior o número de especialistas, humanos ou artificiais, maior passa a ser a importância de um contexto operacional compartilhado que permita conectar todas essas perspectivas.
Sobre o autor
Paulo Florêncio de Menezes é cofundador da Target Solutions e atua há mais de 15 anos em projetos relacionados a infraestrutura, monitoramento, observabilidade, automação e operações de TI e Telecom.
É graduado em Processamento de Dados pela Universidade Federal do Amazonas (UFAM), possui MBA em Gestão Empresarial pela Fundação Dom Cabral (FDC) e Mestrado Profissional em Economia pela Fundação Getulio Vargas (FGV).
Em sua pesquisa de Mestrado, desenvolveu o IBEOP-IA (Índice Brasileiro de Exposição Ocupacional Potencial à Inteligência Artificial), investigando a exposição potencial das ocupações brasileiras às capacidades da IA por meio da combinação de dados ocupacionais, patentes de inteligência artificial e técnicas de processamento de linguagem natural.
Sobre a Target Solutions
A Target Solutions atua há mais de 15 anos apoiando organizações na evolução de suas operações de infraestrutura, monitoramento, observabilidade, automação e AIOps. Ao longo desse período, participou de projetos em ambientes complexos dos setores de Telecom, Tecnologia, Governo, Energia e grandes empresas, com foco no aumento da eficiência operacional e da confiabilidade dos serviços.
Como parte dessa experiência, desenvolveu o ARGUS, uma plataforma de AIOps que complementa as ferramentas já utilizadas pelas organizações e atua como uma camada de inteligência contextual sobre o ecossistema operacional existente.
O ARGUS integra informações provenientes de múltiplas fontes, correlacionando eventos, alarmes, dados de observabilidade, relacionamentos entre componentes, topologia, mudanças, histórico e outras evidências disponíveis no ambiente.
Essa abordagem permite que operadores, especialistas e agentes de Inteligência Artificial trabalhem sobre o mesmo contexto, reduzindo o esforço de investigação, acelerando a identificação da causa provável dos incidentes e apoiando decisões mais rápidas e seguras.
O objetivo não é substituir as ferramentas especializadas já utilizadas pela organização. É conectar as perspectivas produzidas por elas e transformar informações dispersas em contexto operacional compartilhado.
Conheça mais em ARGUS AIOps.