Target Solutions

IA Agêntica

Operações agênticas: estamos preparados para dar autonomia à IA?

À medida que agentes de inteligência artificial deixam de apenas recomendar e começam a decidir e agir, contexto, governança e segurança passam a ser tão importantes quanto a própria inteligência.

Nos últimos artigos desta série, tenho discutido uma questão que considero central para o futuro das operações de TI: agentes de inteligência artificial podem acumular conhecimento técnico extraordinário e, ainda assim, ter dificuldades para compreender o ambiente específico no qual precisam atuar.

Um agente pode conhecer profundamente redes, cloud, Kubernetes, bancos de dados ou praticamente qualquer tecnologia. Pode consultar documentação, analisar grandes volumes de informação e combinar conhecimentos que normalmente estariam distribuídos entre diferentes especialistas.

Mas isso não significa que conheça a arquitetura de uma determinada empresa, as dependências entre seus componentes, as mudanças realizadas recentemente, o histórico dos incidentes, os serviços afetados ou a relação entre um problema técnico e seu impacto sobre o negócio.

Essa diferença entre conhecimento especializado e contexto operacional já seria importante se estivéssemos falando apenas de agentes utilizados para apoiar especialistas humanos.

Mas uma nova questão começa a surgir à medida que avançamos para a chamada IA agêntica.

O que acontece quando esses agentes deixam de apenas analisar e recomendar e começam também a decidir e agir sobre o ambiente?

Recentemente, durante o Telco Transformation Latam, no Rio de Janeiro, tive a oportunidade de acompanhar um painel dedicado justamente à evolução das operações agênticas.

Mais do que as possibilidades da tecnologia, chamou minha atenção a quantidade de desafios que começam a aparecer quando a discussão deixa os casos experimentais e se aproxima de ambientes reais de operação:

  • Visão sistêmica.
  • Integração entre diferentes domínios.
  • Sistemas legados.
  • Governança.
  • Guardrails.
  • Segurança.
  • Supervisão humana.
  • Orquestração de múltiplos agentes.
  • Custos.
  • Mudanças nos processos e na cultura das equipes.

São questões especialmente relevantes para Telecom, mas que não se limitam a esse setor. Elas começam a surgir em qualquer ambiente crítico no qual pretendemos permitir que sistemas de inteligência artificial avancem da recomendação para a execução.

E todas parecem apontar para uma pergunta anterior à própria adoção da tecnologia:

Estamos preparando nossas operações para receber agentes autônomos com a mesma velocidade com que estamos aumentando a capacidade desses agentes?

Talvez essa seja uma das perguntas mais importantes da próxima etapa da adoção da inteligência artificial nas operações.

Da automação para a autonomia

Automação não é novidade nas operações de TI e Telecom.

Há décadas utilizamos scripts, regras, workflows e plataformas especializadas para executar tarefas que anteriormente dependiam da intervenção humana. Com o tempo, essas automações se tornaram cada vez mais sofisticadas e passaram a assumir partes importantes dos processos operacionais.

Mas existe uma característica fundamental em grande parte delas: alguém definiu previamente o caminho que deverá ser percorrido.

Uma condição é identificada, uma regra é acionada e uma sequência conhecida de ações é executada. Mesmo quando o fluxo possui diversas ramificações, existe uma lógica previamente estabelecida determinando o comportamento esperado.

A IA agêntica começa a modificar essa dinâmica.

Um agente pode receber um objetivo, observar o ambiente, consultar diferentes fontes, interpretar informações, formular hipóteses, escolher ferramentas, decidir quais passos executar e ajustar sua estratégia conforme os resultados encontrados.

Essa capacidade abre possibilidades enormes para as operações.

Imagine um incidente que hoje exige que um especialista consulte diferentes plataformas, confronte alarmes, analise logs, verifique mudanças recentes, pesquise documentação, identifique dependências, formule hipóteses e somente depois decida o que fazer.

Um agente pode, potencialmente, participar de várias dessas etapas.

O problema é que existe uma diferença importante entre ajudar alguém a decidir e receber autoridade para executar a decisão.

Enquanto a IA produz uma recomendação, ainda existe uma oportunidade para que um especialista avalie a informação, considere aspectos que eventualmente não tenham sido identificados e decida se aquela recomendação deve ou não ser executada.

Quando o agente passa a agir diretamente sobre o ambiente, esse último ponto de controle pode desaparecer.

Em uma operação crítica, as consequências dessa mudança são significativas.

Uma interpretação incorreta, uma informação desatualizada ou uma relação causal mal estabelecida pode deixar de produzir apenas uma recomendação equivocada e passar a produzir uma ação equivocada.

E quanto maior a autonomia, maior pode ser o impacto dessa ação.

É por isso que a discussão sobre IA agêntica começa a se aproximar de temas que tradicionalmente não ocupavam o centro do debate sobre inteligência artificial: governança, permissões, rastreabilidade, segurança e controle.

A jornada para Autonomous Networks

No setor de Telecom, essa discussão também está avançando dentro da jornada de Autonomous Networks desenvolvida pelo TM Forum.

O modelo estabelece níveis progressivos de autonomia, do L0 ao L5. O Level 4 representa uma mudança particularmente importante porque envolve ambientes mais complexos, inclusive cross-domain, nos quais sistemas passam a analisar situações e tomar decisões utilizando mecanismos preditivos e closed loops orientados aos serviços e à experiência do cliente.

O próprio TM Forum descreve a chegada ao L4 como uma mudança de processos tradicionais de automação definidos por humanos para uma forma efetiva de tomada autônoma de decisão.

Esse avanço já deixou de ser apenas conceitual. Operadoras vêm declarando e validando L4 em domínios e casos de uso específicos, enquanto iniciativas recentes experimentam IA agêntica, raciocínio orquestrado e colaboração entre diferentes domínios.

Mas existe uma questão anterior à autonomia que considero ainda mais importante.

Para decidir corretamente, o agente precisa compreender aquilo sobre o qual está decidindo.

E aqui voltamos ao problema do contexto operacional.

Quanto mais agentes, maior a necessidade de uma visão compartilhada

Imagine um agente especializado em redes de acesso. Outro em transporte. Um terceiro em core. Outros agentes podem estar associados a cloud, aplicações, segurança ou experiência do cliente.

Cada um pode possuir excelente conhecimento técnico e executar muito bem suas tarefas dentro do próprio domínio. Isso não significa que, juntos, compreendam a operação.

Um incidente raramente respeita a arquitetura organizacional que construímos para observá-lo. Uma falha pode começar em determinado componente, produzir sintomas em outro domínio, afetar aplicações, comprometer um serviço e finalmente aparecer para a organização como uma reclamação do cliente.

Se cada agente observar apenas sua parte do ambiente, podemos reproduzir com inteligência artificial um problema que já conhecemos muito bem nas operações atuais: os silos.

Hoje temos silos de ferramentas, dados e equipes. Amanhã poderemos ter também silos de inteligência.

Essa possibilidade produz um paradoxo interessante:

Quanto mais especializados forem os agentes, maior pode se tornar a necessidade de construir uma visão compartilhada da operação.

Essa visão não surge simplesmente porque os agentes são inteligentes.

Ela depende de informações que normalmente estão espalhadas por diversas fontes: eventos, métricas, logs, topologia, inventário, mudanças, tickets, dependências, histórico operacional, dados de serviços e informações sobre clientes.

Mais importante ainda, depende das relações entre essas informações.

Um alarme isolado diz que alguma coisa aconteceu.

O contexto ajuda a explicar onde aconteceu, o que depende daquele componente, quais outros eventos podem estar relacionados, o que mudou recentemente e qual pode ser o impacto sobre os serviços.

Esse é um problema conhecido para especialistas humanos e passa a ser ainda mais importante quando começamos a delegar decisões para máquinas.

Não por acaso, uma das discussões mais recentes do próprio TM Forum sobre a evolução para Level 4 está relacionada ao conceito de knowledge plane: uma camada capaz de transformar dados fragmentados em conhecimento contextualizado e reutilizável que agentes possam compreender, utilizar para raciocinar e sobre o qual possam agir. O objetivo é justamente permitir coordenação cross-domain e decisões mais explicáveis.

As operações atuais não foram construídas para agentes autônomos

Existe, entretanto, outro obstáculo. Grande parte das operações atuais não foi construída imaginando que agentes autônomos precisariam interagir com seus sistemas.

As arquiteturas foram formadas ao longo de anos ou décadas. Diferentes fornecedores utilizam modelos de dados distintos. Algumas plataformas possuem APIs modernas; outras possuem integrações limitadas. Informações importantes podem estar em bancos estruturados, documentos, tickets ou simplesmente no conhecimento acumulado pelas equipes.

Processos também foram desenhados para pessoas e automações determinísticas.

Colocar agentes sobre essa arquitetura não elimina essas limitações. Em alguns casos, pode apenas expô-las com maior clareza.

Antes de pensar em autonomia, portanto, existem ações fundacionais: organizar dados, integrar plataformas, disponibilizar interfaces adequadas, rever processos, definir políticas e construir mecanismos que permitam aos agentes acessar informações confiáveis.

Há também uma dimensão econômica. Agentes capazes de consultar indiscriminadamente grandes volumes de dados, acionar modelos repetidamente e realizar longas cadeias de raciocínio podem ser tecnicamente interessantes e economicamente pouco eficientes. A gestão do consumo computacional e dos tokens passa a fazer parte da própria arquitetura da solução.

E existe uma dimensão humana.

A adoção de agentes modifica responsabilidades, procedimentos e competências dentro das equipes. Especialistas que anteriormente executavam determinadas atividades podem passar a supervisionar decisões, tratar exceções, definir políticas ou analisar situações que os agentes não conseguiram resolver.

Por isso, talvez seja equivocado imaginar a evolução da IA agêntica como uma simples substituição do trabalho humano. Ela parece muito mais uma redistribuição progressiva das responsabilidades entre pessoas e sistemas.

Quanto de autonomia devemos entregar?

A resposta provavelmente não será igual para todos os processos.

Uma alternativa interessante é pensar a autonomia como algo que precisa ser conquistado progressivamente.

Inicialmente, um agente pode apenas observar. Depois, pode formular diagnósticos e recomendar ações. Em uma etapa seguinte, pode executar determinadas tarefas mediante aprovação humana.

Com o aumento da confiança e da maturidade, pode receber autonomia para situações conhecidas, repetitivas e de menor risco, enquanto decisões de maior impacto continuam sendo escaladas para especialistas.

É uma evolução semelhante àquela que naturalmente aplicamos às pessoas.

Um profissional que acaba de entrar em uma operação crítica normalmente não recebe imediatamente a mesma autonomia de alguém com anos de experiência. Responsabilidades são ampliadas à medida que conhecimento, experiência e confiança aumentam.

Com agentes, talvez precisemos adotar princípio semelhante.

A autonomia dos agentes não deveria crescer mais rapidamente do que nossa capacidade de compreender, controlar e auditar suas decisões.

Essa evolução também ajuda a entender melhor qual deve ser o papel da supervisão humana nas operações agênticas.

Um conceito frequentemente utilizado nesse contexto é o human-in-the-loop, no qual determinadas decisões ou ações da IA continuam dependendo da participação, validação ou aprovação de uma pessoa.

A discussão, portanto, não precisa ser reduzida a escolher entre operações controladas por humanos ou operações totalmente autônomas. Diferentes decisões podem exigir diferentes níveis de supervisão.

Ações reversíveis, conhecidas e de baixo impacto podem receber maior autonomia. Situações inéditas, ambíguas ou capazes de produzir impactos significativos podem exigir validação humana.

O nível de autonomia passa, portanto, a depender também de risco, criticidade e confiança.

Guardrails passam a fazer parte da arquitetura operacional

Nesse cenário, guardrails deixam de ser apenas uma recomendação e passam a fazer parte da arquitetura operacional.

O agente precisa saber não apenas o que fazer, mas também o que está autorizado a fazer.

Quais sistemas pode acessar? Quais ações pode executar? Em quais condições? Até qual nível de impacto? Como uma exceção será tratada? Como reconstruiremos posteriormente as decisões tomadas? Como interromperemos uma sequência inadequada?

Essas preocupações já aparecem formalmente no trabalho do TM Forum. Seu guia de segurança para Agentic AI em Autonomous Networks trata de riscos relacionados a raciocínio, memória, uso de ferramentas, autenticação, interação humana e protocolos entre múltiplos agentes.

Isso mostra como a discussão está evoluindo.

Quando a IA apenas produz informação, avaliamos principalmente a qualidade da resposta. Quando ela recebe capacidade de agir, precisamos avaliar todo o sistema ao redor dela.

Da infraestrutura para o serviço e a experiência do cliente

Há ainda uma última mudança que considero fundamental.

Durante muito tempo, operações foram estruturadas principalmente a partir da infraestrutura. Monitoramos equipamentos, interfaces, links, servidores, aplicações e uma quantidade crescente de indicadores técnicos.

Mas o cliente não compra nenhum desses componentes isoladamente. Ele compra um serviço.

Uma rede pode apresentar milhares de indicadores dentro dos parâmetros esperados e, ainda assim, determinado grupo de clientes estar experimentando degradação.

Da mesma forma, dezenas de alarmes tecnicamente diferentes podem representar apenas manifestações distintas de uma mesma falha que afeta um único serviço.

Se pretendemos caminhar para operações mais autônomas, os agentes precisarão progressivamente compreender não apenas a infraestrutura, mas também as relações entre infraestrutura, serviços e experiência do cliente.

Essa mudança de perspectiva já aparece nas iniciativas mais avançadas de Autonomous Networks, que combinam colaboração entre agentes e diferentes domínios justamente para avançar de operações centradas na rede para operações orientadas à experiência.

No fundo, todas essas questões convergem para uma mesma conclusão.

O desenvolvimento dos agentes está avançando rapidamente. Mas uma operação agêntica depende de muito mais do que agentes.

Depende de dados preparados, integrações, processos, governança, segurança, guardrails, supervisão, interoperabilidade e, principalmente, contexto.

Antes de construir uma operação autônoma, precisamos construir uma operação que possa ser compreendida.

Da visão à prática: ARGUS

É justamente nesse ponto que a discussão se conecta ao trabalho que temos desenvolvido com o ARGUS AIOps.

A plataforma nasceu para enfrentar um problema recorrente das operações modernas: existem cada vez mais ferramentas produzindo informações, mas esses dados normalmente permanecem distribuídos em diferentes plataformas e chegam às equipes sem o contexto necessário para compreender rapidamente o que realmente está acontecendo.

O ARGUS atua como uma camada de inteligência sobre esse ambiente. Conecta múltiplas fontes de dados operacionais, consolida e correlaciona eventos, reduz ruído e acrescenta contexto para transformar sinais isolados em uma visão mais compreensível dos incidentes.

Isso significa que o ARGUS não substitui as plataformas de monitoramento, observabilidade ou ITSM que uma organização já utiliza. Da mesma forma, não precisa substituir os agentes especializados que começam a fazer parte dessas arquiteturas.

Seu papel pode ser justamente ajudar pessoas, automações e diferentes agentes a trabalhar sobre uma compreensão mais consistente da mesma operação.

Essa perspectiva amplia também a forma como enxergamos AIOps. Uma camada de inteligência operacional pode servir não apenas aos especialistas humanos, mas progressivamente às automações e aos agentes que começam a receber maior participação nas decisões.

Quanto maior a autonomia que entregarmos aos agentes, maior será a necessidade de garantir que suas decisões sejam tomadas a partir de informações contextualizadas, atualizadas e compartilhadas.

No próximo artigo, pretendo aprofundar a jornada de Autonomous Networks proposta pelo TM Forum e discutir por que alcançar níveis mais elevados de autonomia depende menos de simplesmente adicionar agentes e mais de preparar uma arquitetura capaz de sustentá-los.

Por enquanto, talvez a principal pergunta seja mais simples:

Nossa operação já está preparada para ser compreendida por eles?

Conheça mais sobre o ARGUS AIOps e como estamos trabalhando para transformar dados operacionais distribuídos em contexto para decisões mais rápidas e inteligentes.

Sobre o autor

Paulo Florêncio de Menezes é cofundador da Target Solutions e atua há mais de 15 anos em projetos relacionados a infraestrutura, monitoramento, observabilidade, automação e operações de TI e Telecom.

É graduado em Processamento de Dados pela Universidade Federal do Amazonas (UFAM), possui MBA em Gestão Empresarial pela Fundação Dom Cabral (FDC) e Mestrado Profissional em Economia pela Fundação Getulio Vargas (FGV).

Em sua pesquisa de Mestrado, desenvolveu o IBEOP-IA (Índice Brasileiro de Exposição Ocupacional Potencial à Inteligência Artificial), investigando a exposição potencial das ocupações brasileiras às capacidades da IA por meio da combinação de dados ocupacionais, patentes de inteligência artificial e técnicas de processamento de linguagem natural.

Sobre a Target Solutions

A Target Solutions atua há mais de 15 anos apoiando organizações na evolução de suas operações de infraestrutura, monitoramento, observabilidade, automação e AIOps. Ao longo desse período, participou de projetos em ambientes complexos dos setores de Telecom, Tecnologia, Governo, Energia e grandes empresas, com foco no aumento da eficiência operacional e da confiabilidade dos serviços.

Como parte dessa experiência, desenvolveu o ARGUS, uma plataforma de AIOps que complementa as ferramentas já utilizadas pelas organizações e atua como uma camada de inteligência contextual sobre o ecossistema operacional existente.

O ARGUS integra informações provenientes de múltiplas fontes, correlacionando eventos, alarmes, dados de observabilidade, relacionamentos entre componentes, topologia, mudanças, histórico e outras evidências disponíveis no ambiente.

Essa abordagem permite que operadores, especialistas e agentes de Inteligência Artificial trabalhem sobre o mesmo contexto, reduzindo o esforço de investigação, acelerando a identificação da causa provável dos incidentes e apoiando decisões mais rápidas e seguras.

O objetivo não é substituir as ferramentas especializadas já utilizadas pela organização. É conectar as perspectivas produzidas por elas e transformar informações dispersas em contexto operacional compartilhado.

Conheça mais em ARGUS AIOps.