Target Solutions

IA Agêntica

Um agente pode conhecer tudo sobre uma ferramenta. Ainda assim, não compreender o incidente.

Quando a especialização deixa de ser suficiente

Ao longo da primeira série de artigos, discutimos como as operações de TI se tornaram progressivamente mais complexas à medida que aplicações, serviços, plataformas em nuvem e infraestruturas passaram a funcionar como ecossistemas altamente distribuídos e interdependentes. Essa transformação nos levou a concluir que compreender rapidamente um incidente depende muito mais da capacidade de construir contexto do que da simples disponibilidade de ferramentas de monitoramento ou observabilidade.

Nos dois primeiros artigos desta segunda série, ampliamos essa discussão para o universo da Inteligência Artificial. Primeiro, questionamos a ideia de que agentes especializados, por si só, resolverão os principais desafios das operações modernas no artigo “Os agentes de IA não resolvem o principal problema das operações de TI”. Em seguida, mostramos que qualquer agente depende de um elemento anterior à própria Inteligência Artificial: um contexto operacional compartilhado, capaz de reunir e organizar informações provenientes de múltiplas fontes, em “Antes dos agentes, existe o contexto operacional”.

Essas duas reflexões conduzem naturalmente a uma nova pergunta.

Se o contexto operacional é tão importante, por que um agente especializado não poderia construí-lo sozinho?

A resposta passa por uma característica que, paradoxalmente, representa ao mesmo tempo a maior força e a principal limitação desses agentes.

Eles foram concebidos para serem especialistas.

A força da especialização

Sempre que observamos demonstrações de agentes de Inteligência Artificial, é natural ficarmos impressionados com sua capacidade de executar tarefas altamente específicas. Alguns analisam milhares de linhas de logs em poucos segundos. Outros identificam comportamentos anômalos em plataformas de observabilidade, interpretam métricas de infraestrutura, sugerem procedimentos de recuperação, consultam bases de conhecimento ou automatizam atividades dentro de sistemas de ITSM.

Essa especialização representa um avanço extraordinário. Durante muitos anos, grande parte dessas atividades dependia exclusivamente da experiência acumulada pelos profissionais responsáveis pela operação. Hoje, boa parte desse conhecimento pode ser incorporada a agentes capazes de executar análises com rapidez, consistência e disponibilidade praticamente contínuas.

É difícil imaginar que esse movimento não continuará acelerando.

Muito provavelmente veremos surgir agentes cada vez mais especializados. Alguns conhecerão profundamente ambientes Kubernetes. Outros serão treinados para plataformas específicas de observabilidade, segurança, bancos de dados, redes, computação em nuvem ou aplicações corporativas.

Em pouco tempo, será comum encontrarmos organizações operando dezenas de agentes diferentes, cada um responsável por um domínio específico da infraestrutura.

Sob a perspectiva da produtividade, esse cenário é extremamente positivo. Especialistas, sejam humanos ou artificiais, tendem a produzir análises mais precisas quando atuam dentro do domínio para o qual foram preparados.

O desafio começa quando o incidente deixa de respeitar esses mesmos limites. Quem trabalha em operações sabe que os problemas mais críticos raramente permanecem confinados a uma única tecnologia.

Um comportamento aparentemente observado na aplicação pode ter origem em uma alteração realizada na infraestrutura. Uma degradação percebida pelos usuários pode resultar de mudanças em políticas de segurança, de um serviço em nuvem, de uma fila de mensagens ou de uma dependência externa que nenhuma ferramenta, isoladamente, consegue enxergar por completo.

Nessas situações, o conhecimento profundo sobre uma única plataforma continua sendo extremamente valioso, mas deixa de ser suficiente, porque o incidente não acontece dentro da ferramenta. Ele acontece na operação.

O incidente não respeita fronteiras tecnológicas

A principal virtude de um especialista sempre foi conhecer profundamente o domínio em que atua. Em operações de TI, isso nunca foi diferente. Ao longo das últimas décadas, a crescente sofisticação das tecnologias levou as organizações a formar equipes cada vez mais especializadas. Surgiram profissionais dedicados exclusivamente à infraestrutura, às redes, aos bancos de dados, à segurança, à computação em nuvem, às plataformas de observabilidade e às aplicações.

Essa especialização aumentou significativamente a qualidade técnica das operações e permitiu acompanhar a velocidade com que novos serviços e arquiteturas passaram a ser incorporados aos ambientes corporativos.

Com os agentes de Inteligência Artificial, estamos observando um movimento semelhante.

Em vez de um único modelo responsável por todas as atividades, começa a surgir um ecossistema de agentes especializados, cada um treinado para interpretar um determinado conjunto de informações, executar tarefas específicas ou apoiar decisões em um domínio muito bem definido. É uma evolução natural e, na maioria dos casos, extremamente desejável.

O desafio aparece quando olhamos para a natureza dos incidentes que essas organizações precisam enfrentar.

Os incidentes mais críticos raramente seguem a divisão organizacional das equipes ou das ferramentas. Uma alteração aparentemente simples em um serviço de autenticação pode provocar aumento de latência em aplicações, desencadear falhas de comunicação entre microsserviços, gerar filas em sistemas de mensageria, aumentar a utilização de recursos em nuvem e, poucos minutos depois, produzir uma avalanche de chamados no Service Desk. Cada uma dessas manifestações será percebida por uma ferramenta diferente e, consequentemente, por um agente diferente.

Nenhum deles estará errado. Cada agente estará descrevendo, com precisão, aquilo que consegue observar. O problema é que o incidente nunca esteve restrito a nenhuma dessas perspectivas. Ele surgiu justamente das relações entre elas.

Essa distinção parece sutil, mas ajuda a explicar por que operações modernas continuam investindo tanto esforço na correlação de eventos e na construção de uma visão integrada do ambiente. O objetivo nunca foi apenas reunir informações em um único lugar. O verdadeiro desafio consiste em compreender como acontecimentos aparentemente independentes passam a fazer parte da mesma cadeia causal quando observados em conjunto.

É justamente nesse ponto que percebemos que a especialização, embora indispensável, possui um limite natural. Ela amplia profundamente a capacidade de compreender uma parte da operação.

Mas compreender o incidente exige compreender as conexões entre todas essas partes.

O verdadeiro desafio não é interpretar informações. É conectar perspectivas.

Quando um grande incidente mobiliza uma operação, raramente existe falta de informação. Pelo contrário. Em poucos minutos, dashboards começam a registrar degradações, plataformas de observabilidade apresentam alterações de comportamento, ferramentas de monitoramento disparam alertas, sistemas de ITSM recebem novos chamados e diferentes equipes iniciam suas próprias investigações.

Cada profissional observa o problema a partir da área pela qual é responsável. Cada ferramenta apresenta uma representação coerente da realidade. Cada agente especializado, da mesma forma, tende a produzir análises consistentes dentro do universo de informações que recebeu.

Ainda assim, quem já participou de uma war room sabe que, durante boa parte da investigação, ninguém consegue afirmar com segurança o que realmente está acontecendo.

Essa aparente contradição merece atenção. O problema não está na qualidade das análises individuais. Também não está na competência das equipes ou na capacidade dos agentes de Inteligência Artificial.

O verdadeiro desafio está em conectar todas essas interpretações para construir uma compreensão comum do incidente, e é justamente nesse momento que percebemos uma diferença importante entre responder perguntas e compreender situações complexas.

Responder perguntas costuma exigir conhecimento. Compreender um incidente exige relacionar conhecimentos provenientes de diferentes perspectivas. Essa diferença pode parecer apenas conceitual, mas altera profundamente a arquitetura das operações modernas.

Imagine uma equipe reunida para investigar uma degradação significativa em uma plataforma de serviços financeiros. O especialista em banco de dados demonstra que não existem consultas lentas nem bloqueios relevantes. A equipe de infraestrutura confirma que servidores, armazenamento e recursos computacionais permanecem dentro dos limites previstos.

A observabilidade aponta aumento expressivo no tempo de resposta das aplicações. A equipe responsável pela rede identifica um crescimento incomum na latência entre dois ambientes. Paralelamente, o ITSM registra um aumento contínuo de reclamações dos usuários.

Todos esses diagnósticos podem estar absolutamente corretos, mas ainda assim, nenhum deles explica, isoladamente, o incidente.

A compreensão começa a surgir somente quando essas informações deixam de ser analisadas de forma independente e passam a ser interpretadas como partes de uma mesma história.

Essa mudança de perspectiva ajuda a explicar por que organizações mais maduras costumam resolver grandes incidentes com mais rapidez, mesmo utilizando ferramentas semelhantes às disponíveis em outras empresas.

O diferencial raramente está na quantidade de dados coletados ou na sofisticação das plataformas empregadas e sim na capacidade de transformar múltiplas perspectivas em uma visão compartilhada da realidade operacional.

É exatamente essa visão compartilhada que permite eliminar hipóteses incorretas mais cedo, coordenar melhor o trabalho das equipes e reduzir o tempo necessário para identificar a causa mais provável do problema.

Quando observamos esse processo sob a ótica da Inteligência Artificial, a conclusão torna-se praticamente inevitável.

Se pessoas especialistas precisam compartilhar contexto para compreender um incidente distribuído, por que esperaríamos que agentes especializados conseguissem chegar a essa compreensão trabalhando de forma isolada?

A inteligência da operação será medida pela capacidade de compartilhar contexto

Ao longo dos últimos anos, tornou-se comum associar a evolução das operações de TI ao avanço da Inteligência Artificial. Essa percepção é compreensível. Os modelos evoluíram rapidamente, os agentes especializados passaram a executar tarefas cada vez mais sofisticadas e a expectativa de automação cresceu de forma significativa.

Entretanto, ao analisarmos a arquitetura das operações modernas, percebemos que essa transformação não depende apenas da evolução dos agentes.

Ela depende, principalmente, da forma como esses agentes conseguem compreender o ambiente em que estão inseridos.

Especialização continua sendo um enorme diferencial. Um agente treinado para interpretar logs, analisar métricas de observabilidade, acompanhar mudanças de infraestrutura ou apoiar processos de ITSM pode produzir resultados extraordinários dentro do seu domínio de atuação. Quanto maior o conhecimento especializado, maior tende a ser a qualidade das análises produzidas.

O problema é que incidentes críticos raramente permanecem confinados a um único domínio. Eles surgem das relações entre aplicações, infraestrutura, redes, serviços em nuvem, segurança, integrações e processos de negócio.

São justamente essas relações que tornam a investigação tão desafiadora e explicam por que equipes experientes precisam reunir diferentes especialistas para construir uma compreensão única do problema.

Com os agentes de Inteligência Artificial, essa lógica permanece exatamente a mesma.

Teremos agentes cada vez mais preparados para analisar partes específicas da operação. Alguns serão especialistas em observabilidade. Outros dominarão plataformas de nuvem, bancos de dados, segurança ou infraestrutura. Todos poderão contribuir de forma significativa para acelerar investigações e apoiar decisões.

Mas nenhum deles, isoladamente, conseguirá representar toda a complexidade de um ambiente distribuído. A diferença entre uma coleção de agentes especializados e uma operação verdadeiramente inteligente não estará, portanto, na quantidade de agentes disponíveis. Ela estará na capacidade de fazer com que todos trabalhem sobre a mesma compreensão da realidade operacional. Essa talvez seja a principal mudança de paradigma que começaremos a observar nos próximos anos.

Durante muito tempo, investimos para construir plataformas capazes de monitorar sistemas, coletar métricas, registrar logs e ampliar a observabilidade. Agora, passamos a enfrentar um novo desafio: criar uma arquitetura que permita transformar todas essas informações em um contexto operacional compartilhado, suficientemente consistente para orientar pessoas e Inteligências Artificiais ao mesmo tempo.

Quando isso acontece, os agentes deixam de atuar como especialistas isolados e passam a colaborar sobre uma mesma representação da operação. Cada um continua utilizando seu conhecimento específico, mas suas conclusões deixam de competir entre si e passam a complementar umas às outras.

Essa é uma diferença sutil, ao mesmo tempo, pode representar uma das maiores transformações já vividas pelas operações de TI.

O próximo passo dessa evolução

Se agentes especializados dependem de um contexto comum para compreender incidentes complexos, surge naturalmente uma nova pergunta.

Quem será responsável por construir e manter esse contexto?

Responder a essa questão exige olhar para um novo componente da arquitetura das operações modernas. Não uma ferramenta adicional, nem um novo agente especializado, mas uma camada capaz de integrar informações provenientes de múltiplas fontes, preservar as relações entre elas e disponibilizar uma representação única da realidade operacional para todos os participantes da operação.

É justamente essa arquitetura que começaremos a explorar no próximo artigo.

Discutiremos por que a próxima geração de AIOps deixará de ser vista como um conjunto de ferramentas independentes e passará a ser construída sobre plataformas de contexto, capazes de conectar dados, pessoas e agentes em torno de uma mesma compreensão dos incidentes.

Na prática, talvez essa seja a diferença entre utilizar Inteligência Artificial nas operações e construir operações verdadeiramente orientadas por Inteligência Artificial.

Sobre o autor

Paulo Florêncio de Menezes é cofundador da Target Solutions e atua há mais de 15 anos em projetos relacionados a infraestrutura, monitoramento, observabilidade, automação e operações de TI e Telecom.

É graduado em Processamento de Dados pela Universidade Federal do Amazonas (UFAM), possui MBA em Gestão Empresarial pela Fundação Dom Cabral (FDC) e Mestrado Profissional em Economia pela Fundação Getulio Vargas (FGV).

Em sua pesquisa de Mestrado, desenvolveu o IBEOP-IA (Índice Brasileiro de Exposição Ocupacional Potencial à Inteligência Artificial), investigando a exposição potencial das ocupações brasileiras às capacidades da IA por meio da combinação de dados ocupacionais, patentes de inteligência artificial e técnicas de processamento de linguagem natural.

Sobre a Target Solutions

A Target Solutions atua há mais de 15 anos apoiando organizações na evolução de suas operações de infraestrutura, monitoramento, observabilidade, automação e AIOps. Ao longo desse período, participou de projetos em ambientes complexos dos setores de Telecom, Tecnologia, Governo, Energia e grandes empresas, com foco no aumento da eficiência operacional e da confiabilidade dos serviços.

Como parte dessa experiência, desenvolveu o ARGUS, uma plataforma de AIOps que complementa as ferramentas já utilizadas pelas organizações e atua como uma camada de inteligência contextual sobre o ecossistema operacional existente.

O ARGUS integra informações provenientes de múltiplas fontes, correlacionando eventos, alarmes, dados de observabilidade, relacionamentos entre componentes, topologia, mudanças, histórico e outras evidências disponíveis no ambiente.

Essa abordagem permite que operadores, especialistas e agentes de Inteligência Artificial trabalhem sobre o mesmo contexto, reduzindo o esforço de investigação, acelerando a identificação da causa provável dos incidentes e apoiando decisões mais rápidas e seguras.

O objetivo não é substituir as ferramentas especializadas já utilizadas pela organização. É conectar as perspectivas produzidas por elas e transformar informações dispersas em contexto operacional compartilhado.

Conheça mais em ARGUS AIOps.