IA Agêntica
Os agentes de IA não resolvem o principal problema das operações de TI
Uma nova etapa desta conversa
Ao longo da série Operações Modernas de TI, exploramos como a crescente complexidade dos ambientes tecnológicos mudou a natureza dos desafios enfrentados pelas equipes de operações. Discutimos por que tantas organizações continuam apagando incêndios, como o avanço da observabilidade foi acompanhado por um volume cada vez maior de alertas, por que detectar um incidente costuma ser relativamente simples, mas construir o contexto necessário para identificar sua causa raiz continua sendo uma das tarefas mais difíceis da operação, como a observabilidade representa uma nova forma de operar e por que reduzir o MTTR depende muito mais da velocidade com que compreendemos um incidente do que da velocidade com que executamos sua recuperação.
Se os cinco primeiros artigos procuraram compreender como as operações modernas evoluíram até chegar aos desafios atuais, esta nova série parte de uma pergunta diferente.
Como a Inteligência Artificial transformará a forma como as operações de TI serão estruturadas nos próximos anos?
É uma discussão particularmente relevante porque, nos últimos meses, tornou-se praticamente impossível participar de um evento de tecnologia, abrir uma publicação especializada ou conversar com fornecedores sem encontrar uma nova promessa relacionada aos agentes de Inteligência Artificial.
Estamos fazendo a pergunta errada
A cada semana surgem soluções capazes de analisar logs, interpretar métricas, executar playbooks, abrir chamados automaticamente, investigar falhas em ambientes Kubernetes, administrar recursos em nuvem ou auxiliar equipes de desenvolvimento e operações. A velocidade com que essas soluções evoluem impressiona e, em muitos casos, justifica o entusiasmo que o mercado vem demonstrando.
A discussão deixou de ser se os agentes serão utilizados pelas empresas. A pergunta passou a ser quantos agentes cada organização deverá possuir e quais atividades poderão ser delegadas a eles.
Tudo indica que essa transformação realmente acontecerá, mas talvez estejamos começando essa conversa pela pergunta errada.
Ao longo da primeira série de artigos, vimos que o principal desafio das operações modernas nunca foi a ausência de ferramentas capazes de executar tarefas. Também não foi a falta de monitoramento, de observabilidade ou de especialistas.
O verdadeiro desafio sempre esteve na capacidade de compreender rapidamente o que está acontecendo em ambientes cada vez mais distribuídos, heterogêneos e interdependentes.
Essa distinção parece sutil, mas muda completamente a forma como devemos analisar a atual onda de agentes de Inteligência Artificial.
Se acreditarmos que o maior problema das operações é executar atividades repetitivas, então faz sentido imaginar que agentes especializados representarão, por si só, a próxima grande evolução da área. Afinal, eles poderão automatizar investigações, interpretar informações técnicas e até executar ações corretivas com muito mais rapidez do que fazemos hoje.
Mas será que esse é realmente o principal problema?
Um incidente raramente respeita as fronteiras das ferramentas
Imagine uma operação que utiliza diferentes plataformas para administrar seu ambiente tecnológico.
O monitoramento da infraestrutura é realizado por uma ferramenta. A observabilidade das aplicações utiliza outra. Os logs são centralizados em uma terceira plataforma. O gerenciamento de serviços de TI acontece em um sistema de ITSM. A nuvem disponibiliza seus próprios mecanismos de monitoramento. Equipamentos de rede, bancos de dados, soluções de segurança e aplicações críticas também produzem continuamente eventos, métricas e alertas.
Agora imagine que cada uma dessas plataformas passe a contar com seu próprio agente de Inteligência Artificial.
Individualmente, esse cenário parece extremamente promissor.
O agente especializado em observabilidade consegue interpretar traces e métricas das aplicações. O agente responsável pelo monitoramento identifica rapidamente alterações de disponibilidade. Outro agente analisa logs em busca de padrões anormais. Um quarto acompanha mudanças recentes na infraestrutura. O ITSM utiliza um agente capaz de correlacionar chamados semelhantes e sugerir procedimentos de atendimento.
Cada um desses agentes pode ser altamente competente dentro do domínio que conhece.
O problema é que incidentes reais raramente permanecem confinados a um único domínio.
Uma alteração de configuração realizada em um serviço de autenticação pode provocar aumento na latência de determinadas APIs. Essa degradação gera filas em outro componente, que passa a consumir mais recursos computacionais, produzindo novos alertas de infraestrutura, impactando a experiência dos usuários e aumentando o volume de chamados registrados pelo Service Desk.
Nenhum desses eventos é falso, e todos representam manifestações legítimas do mesmo incidente. Entretanto, cada agente continuará observando apenas a parcela da realidade acessível à plataforma onde está inserido.
É justamente nesse ponto que surge uma pergunta muito mais importante do que simplesmente saber quantos agentes uma organização deverá possuir.
O problema não é a inteligência dos agentes
A pergunta com a qual encerramos a seção anterior talvez seja a mais importante deste artigo.
Quem será responsável por conectar todas essas visões?
Essa questão costuma passar despercebida porque, quando observamos demonstrações de agentes de Inteligência Artificial, normalmente enxergamos apenas um domínio específico. Vemos um agente analisando logs, outro interpretando métricas, outro sugerindo ações para uma plataforma de observabilidade ou automatizando atividades dentro de uma ferramenta de ITSM. Em todos esses cenários, os resultados costumam ser impressionantes.
Não há dúvida de que essas soluções representam um avanço importante.
Seria um erro subestimar sua capacidade de aumentar a produtividade das equipes e automatizar tarefas que até pouco tempo atrás dependiam exclusivamente da intervenção humana.
O ponto central, entretanto, não é esse. O verdadeiro desafio começa quando deixamos de observar cada ferramenta isoladamente e passamos a analisar o comportamento da operação como um todo. Incidentes relevantes quase nunca permanecem confinados a uma única plataforma.
Em uma grande instituição financeira, por exemplo, uma simples alteração em um serviço de autenticação pode afetar aplicações móveis, APIs utilizadas por parceiros, sistemas internos, mecanismos de segurança, filas de processamento e bancos de dados distribuídos. Cada plataforma registrará apenas os sintomas que consegue observar. Para o agente responsável pelos logs, o problema parecerá um conjunto específico de mensagens de erro. Para o agente da infraestrutura, será um aumento no consumo de recursos. Para o agente da observabilidade, uma degradação de desempenho. Para o ITSM, um crescimento repentino no número de chamados.
Nenhum deles estará errado, mas nenhum deles possuirá, individualmente, informações suficientes para compreender o incidente em toda a sua extensão.
Esse comportamento não decorre de uma limitação da Inteligência Artificial, ele decorre da própria arquitetura das operações modernas.
Cada ferramenta foi construída para observar um domínio específico da tecnologia. Naturalmente, os agentes desenvolvidos sobre essas plataformas herdam essa mesma perspectiva. Quanto mais especializados se tornam, maior tende a ser sua capacidade de interpretar os dados daquele domínio. Em contrapartida, menor é sua capacidade de compreender eventos que extrapolam os limites da própria ferramenta.
Essa característica merece atenção porque o mercado tem concentrado boa parte de seus investimentos justamente no desenvolvimento desses especialistas digitais.
Estamos assistindo ao surgimento de agentes para nuvem, redes, bancos de dados, observabilidade, segurança, desenvolvimento, atendimento, infraestrutura e praticamente todas as disciplinas das operações de TI.
É uma evolução extremamente positiva, mas ela não elimina uma pergunta fundamental.
Como todos esses especialistas compartilharão uma mesma compreensão do incidente?
A próxima barreira criada pela complexidade das operações
Essa talvez seja a próxima grande transformação pela qual as operações de TI passarão.
Durante muitos anos, o desafio consistiu em integrar ferramentas de monitoramento, observabilidade, automação e ITSM. Agora começamos a caminhar para um cenário em que também será necessário integrar inteligências.
Cada agente produzirá análises, hipóteses, recomendações e decisões baseadas nas informações às quais possui acesso. Quanto maior o número de agentes especializados, maior também será a necessidade de garantir que todos trabalhem sobre uma mesma realidade operacional.
Caso contrário, corremos o risco de reproduzir, em escala ainda maior, um problema que já conhecemos muito bem.
Hoje, diferentes equipes analisam diferentes ferramentas e frequentemente chegam a interpretações distintas sobre um mesmo incidente.
Amanhã, poderemos ter diferentes agentes analisando diferentes plataformas e chegando exatamente ao mesmo tipo de divergência.
Em outras palavras, a Inteligência Artificial pode aumentar significativamente nossa capacidade de analisar informações. Mas isso não significa, automaticamente, que aumentará nossa capacidade de construir uma compreensão única do que realmente está acontecendo.
Essa diferença é importante porque muda completamente o foco da discussão.
Talvez o maior desafio da próxima geração de operações não seja desenvolver agentes cada vez mais inteligentes.
Talvez seja criar uma forma de oferecer a todos eles o mesmo contexto operacional, permitindo que suas análises deixem de ser apenas corretas dentro de um domínio específico e passem a fazer sentido dentro do comportamento completo da operação.
Essa mudança de perspectiva nos leva, naturalmente, à pergunta que encerra esta segunda parte.
E se o verdadeiro ativo estratégico das operações modernas não forem os agentes, mas o contexto compartilhado sobre o qual eles trabalham?
O contexto é o ponto de partida, não o resultado
Existe uma tendência natural quando falamos sobre Inteligência Artificial aplicada às operações de TI.
Imaginamos que, à medida que os agentes evoluírem, eles passarão a compreender melhor os incidentes. Afinal, se conseguem interpretar logs, correlacionar eventos dentro de uma plataforma e sugerir ações corretivas, parece razoável concluir que, com modelos cada vez mais sofisticados, essa compreensão se tornará praticamente ilimitada.
Essa conclusão, entretanto, parte de uma premissa que merece ser questionada: nenhum agente consegue raciocinar sobre informações às quais não possui acesso.
Essa limitação não está relacionada à qualidade do modelo de linguagem nem à quantidade de parâmetros utilizada em seu treinamento. Trata-se de uma característica inerente a qualquer sistema de Inteligência Artificial: sua capacidade de análise depende diretamente do contexto disponível no momento em que precisa tomar uma decisão.
Pense em um médico especialista que recebe apenas o resultado de um exame de sangue.
Mesmo sendo um excelente profissional, dificilmente emitirá um diagnóstico definitivo sem conhecer o histórico do paciente, os sintomas apresentados, os medicamentos utilizados, os exames anteriores e outros elementos que permitam compreender o quadro clínico como um todo.
Nas operações de TI acontece exatamente o mesmo.
Um agente pode interpretar perfeitamente os eventos registrados por uma plataforma de observabilidade. Outro pode compreender detalhadamente os logs de uma aplicação. Um terceiro pode analisar alterações recentes na infraestrutura ou identificar comportamentos anômalos em serviços de nuvem.
Cada um produzirá análises consistentes, cada um formulará hipóteses coerentes, e cada um poderá recomendar ações tecnicamente corretas. Mas todos continuarão limitados pelo contexto que receberam.
É justamente por isso que a discussão sobre agentes não pode ser separada da discussão sobre contexto operacional.
Quanto mais distribuídos se tornam os ambientes tecnológicos, maior passa a ser a diferença entre possuir informação e possuir entendimento.
Uma organização pode contar com dezenas de agentes extremamente competentes, cada um analisando milhares de eventos por segundo, e ainda assim gastar longos minutos tentando responder à mesma pergunta que acompanha as operações há décadas:
O que realmente está acontecendo?
A resposta dificilmente estará em uma única ferramenta, e também não estará em um único agente.
Ela estará na capacidade de reunir informações provenientes de diferentes plataformas, compreender as relações de dependência existentes entre aplicações, infraestrutura, redes, serviços em nuvem e processos de negócio, reconstruindo a sequência de eventos que levou ao incidente.
Esse talvez seja o principal equívoco da discussão atual sobre Inteligência Artificial aplicada às operações.
Estamos investindo grande parte da nossa atenção em tornar cada agente mais inteligente, mas talvez devêssemos dedicar a mesma atenção ao ambiente em que esses agentes irão trabalhar. Porque agentes inteligentes operando sobre informações fragmentadas continuarão produzindo interpretações fragmentadas.
Uma nova camada na arquitetura das operações
Essa mudança de perspectiva nos leva a uma consequência interessante.
Durante muitos anos, as organizações estruturaram suas operações sobre diferentes camadas tecnológicas. O monitoramento observava disponibilidade. A observabilidade ampliava a capacidade de investigação. O ITSM organizava processos. Ferramentas de automação executavam procedimentos operacionais.
Os agentes de Inteligência Artificial tendem a ocupar uma nova camada dessa arquitetura.
Eles irão interpretar informações, recomendar ações, automatizar atividades e apoiar decisões de maneira cada vez mais sofisticada.
Mas existe uma camada anterior que começa a ganhar importância estratégica: a camada responsável por construir o contexto operacional compartilhado.
É nela que informações provenientes de monitoramento, observabilidade, logs, eventos, topologia, dependências entre serviços, mudanças recentes, CMDB, plataformas de nuvem e indicadores de negócio passam a formar uma visão única do ambiente.
Somente quando esse contexto existe é que agentes especializados conseguem deixar de atuar como excelentes especialistas isolados e passam a colaborar sobre uma mesma compreensão do incidente.
Essa talvez seja a principal mudança arquitetural que veremos nos próximos anos.
A discussão deixará de ser apenas quantos agentes uma organização possui, e passará a ser como todos esses agentes compartilham a mesma visão da operação.
E essa pergunta prepara naturalmente a reflexão que encerrará este artigo.
Se agentes representam uma nova camada de inteligência operacional, qual será o papel das plataformas responsáveis por construir e manter esse contexto compartilhado?
O próximo passo das operações de TI
Sempre que uma nova tecnologia surge, existe uma tendência natural de imaginarmos que ela resolverá, sozinha, os principais desafios da geração anterior.
Foi assim com o monitoramento, depois com a observabilidade, e mais recentemente com a automação.
Agora, vivemos esse mesmo movimento em torno dos agentes de Inteligência Artificial.
Todos esses avanços representam, sem dúvida, uma evolução importante das operações de TI.
Entretanto, ao longo dos últimos cinco artigos desta série, vimos que os maiores desafios das operações modernas nunca estiveram apenas na capacidade de coletar informações, automatizar tarefas ou executar procedimentos com maior velocidade.
Eles sempre estiveram relacionados à capacidade de compreender ambientes cada vez mais complexos.
Essa constatação continua válida na era da Inteligência Artificial.
Agentes especializados serão capazes de interpretar informações, recomendar ações e automatizar processos com uma eficiência cada vez maior. Provavelmente transformarão profundamente a forma como operamos ambientes tecnológicos.
Mas existe uma pergunta que continuará existindo independentemente do número de agentes presentes na organização.
Todos eles estarão trabalhando sobre a mesma compreensão do incidente?
Se a resposta for negativa, corremos o risco de reproduzir um problema que já conhecemos muito bem.
Hoje, diferentes especialistas analisam diferentes ferramentas e precisam construir coletivamente uma explicação para o que está acontecendo.
Amanhã, poderemos ter agentes extremamente inteligentes analisando diferentes plataformas e enfrentando exatamente o mesmo desafio.
Isso nos leva a uma conclusão que, talvez, seja mais importante do que a própria discussão sobre agentes.
O verdadeiro diferencial competitivo das operações modernas provavelmente não estará na quantidade de Inteligências Artificiais disponíveis, mas na qualidade do contexto operacional compartilhado que permitirá a todas elas interpretar uma mesma realidade.
Talvez essa seja a próxima grande evolução das operações de TI.
Não uma evolução baseada apenas em agentes.
Mas uma evolução baseada na capacidade de construir uma visão integrada do ambiente, capaz de conectar informações provenientes de múltiplas fontes, revelar relações de dependência entre serviços e oferecer uma compreensão comum sobre aquilo que realmente está acontecendo.
Quando isso acontece, pessoas e Inteligências Artificiais deixam de competir pela interpretação dos dados e passam a colaborar sobre uma mesma base de conhecimento.
É justamente essa mudança de perspectiva que, na minha opinião, definirá a próxima geração das operações de TI.
No próximo artigo, aprofundaremos exatamente essa ideia ao discutir por que, antes de desenvolver agentes cada vez mais sofisticados, as organizações precisarão construir aquilo que talvez seja seu ativo mais importante: o contexto operacional compartilhado.
Para refletir
A discussão sobre Inteligência Artificial nas operações de TI não deveria começar perguntando quantos agentes uma organização pretende utilizar.
Talvez a pergunta mais importante seja outra.
Como esses agentes construirão uma compreensão comum sobre um incidente que atravessa dezenas de plataformas diferentes?
Porque agentes especializados podem interpretar muito bem uma ferramenta.
Mas somente um contexto operacional compartilhado permite compreender toda a operação.
Sobre o autor
Paulo Florêncio de Menezes é cofundador da Target Solutions e atua há mais de 15 anos em projetos relacionados a infraestrutura, monitoramento, observabilidade, automação e operações de TI e Telecom.
É graduado em Processamento de Dados pela Universidade Federal do Amazonas (UFAM), possui MBA em Gestão Empresarial pela Fundação Dom Cabral (FDC) e Mestrado Profissional em Economia pela Fundação Getulio Vargas (FGV).
Em sua pesquisa de Mestrado, desenvolveu o IBEOP-IA (Índice Brasileiro de Exposição Ocupacional Potencial à Inteligência Artificial), investigando a exposição potencial das ocupações brasileiras às capacidades da IA por meio da combinação de dados ocupacionais, patentes de inteligência artificial e técnicas de processamento de linguagem natural.
Sobre a Target Solutions
A Target Solutions atua há mais de 15 anos apoiando organizações na evolução de suas operações de infraestrutura, monitoramento, observabilidade, automação e AIOps. Ao longo desse período, participou de projetos em ambientes complexos dos setores de Telecom, Tecnologia, Governo, Energia e grandes empresas, com foco no aumento da eficiência operacional e da confiabilidade dos serviços.
Como parte dessa experiência, desenvolveu o ARGUS, uma plataforma de AIOps que complementa as ferramentas já utilizadas pelas organizações e atua como uma camada de inteligência contextual sobre o ecossistema operacional existente.
O ARGUS integra informações provenientes de múltiplas fontes, correlacionando eventos, alarmes, dados de observabilidade, relacionamentos entre componentes, topologia, mudanças, histórico e outras evidências disponíveis no ambiente.
Essa abordagem permite que equipes e agentes de Inteligência Artificial trabalhem sobre o mesmo contexto, reduzindo o esforço de investigação, acelerando a identificação da causa provável dos incidentes e apoiando decisões mais rápidas e seguras.
O objetivo não é substituir as ferramentas especializadas já utilizadas pela organização. É conectar as perspectivas produzidas por elas e transformar informações dispersas em contexto operacional compartilhado.
Conheça mais em ARGUS AIOps.