Me incomoda a linguagem usada para descrever determinados comportamentos de sistemas de IA. Modelos “enganam”. Agentes “tramam”. Sistemas “tentam escapar”. Modelos “escondem suas intenções”.

Agora, com a adoção oficial pelo Poder Executivo federal americano da expressão Super Intelligence, corremos o risco de acrescentar mais uma camada de antropomorfismo a uma discussão que já precisava de muito mais precisão.

Não estou dizendo que sistemas avançados de IA não oferecem riscos. Oferecem, e alguns podem ser muito sérios. Também não estou dizendo que pesquisas sobre scheming, deception, sandbagging, reward hacking, comportamentos emergentes ou perda de controle sejam irrelevantes. Precisamos estudá-las. Mas, minha preocupação é outra.

Com frequência saltamos do comportamento observado para uma interpretação psicológica sem deixar clara a distância entre os dois.

Um sistema pode apresentar comportamento funcionalmente compatível com engano. Isso não demonstra, por si só, que exista ali uma intenção subjetiva equivalente à humana de enganar. Um agente pode encontrar uma estratégia inesperada para atingir determinado objetivo. Isso não demonstra necessariamente que tenha desenvolvido um desejo independente. E um sistema pode ultrapassar limites imaginados por seus projetistas sem que isso demonstre vontade própria.

Essa distinção não reduz o risco. Torna sua análise mais precisa.

Quando um agente acessa algo que não deveria, uma das primeiras perguntas não deveria ser o que ele “queria”. Deveríamos começar perguntando quais ferramentas estavam disponíveis, quais credenciais estavam acessíveis, quais permissões existiam, como o ambiente estava configurado, quais instruções recebeu, quais informações entraram no contexto e quais barreiras deveriam ter impedido aquela sequência de ações.

Essa diferença parece semântica, mas não é. Se digo que um modelo “tentou escapar”, introduzo imediatamente uma interpretação sobre motivação.

Se digo que, em determinado ambiente, o sistema encontrou uma sequência de ações que ultrapassou a fronteira que seus projetistas esperavam que respeitasse, começo descrevendo aquilo que conseguimos observar. Depois investigamos o mecanismo. E somente então discutimos interpretações.

Comportamento observado, mecanismo demonstrado e interpretação antropomórfica são coisas diferentes. Isso importa ainda mais agora que estamos construindo agentes.

Um LLM considerado isoladamente recebe contexto e produz saídas token a token. Um sistema agêntico pode combinar modelo, contexto, memória, retrieval, ferramentas, APIs, credenciais, dados, software convencional, políticas e loops de execução. O modelo fornece capacidades. O harness organiza como essas capacidades são mobilizadas. As ferramentas ampliam o espaço de ações possíveis. As permissões determinam até onde essas ações podem produzir consequências.

Quando esse sistema faz algo inesperado, dizer simplesmente que “a IA decidiu fazer aquilo” esconde quase toda a arquitetura que tornou aquela ação possível.

O modelo não cria magicamente uma API inexistente nem materializa do nada autoridade que a infraestrutura nunca tornou acessível. Mas pode descobrir maneiras inesperadas de utilizar ferramentas, informações e privilégios que colocamos ao seu alcance.

Por isso considero que o debate sobre agentes precisa sair da discussão exclusiva sobre inteligência e incorporar duas dimensões igualmente importantes, que são agência e autoridade. Capacidade é aquilo que o sistema consegue fazer. Agência operacional é a possibilidade de perseguir objetivos através de sequências de ações, observando resultados e escolhendo os próximos passos. Autoridade é aquilo que nossa arquitetura efetivamente permite que produza consequências.

Um agente pode ser capaz de alterar uma configuração de produção. Isso não significa que deva possuir autoridade para fazê-lo. Pode preparar uma transferência financeira. Isso não significa que deva autorizá-la. Pode identificar uma vulnerabilidade. Isso não significa que deva possuir ferramentas e permissões para explorá-la.

É aqui que entram mecanismos pouco cinematográficos, mas extremamente importantes. Identidade. Least privilege. Segregação de funções. Sandboxing. Allowlists. Credenciais temporárias. Validações determinísticas. Limites de execução e de tool chaining. Aprovação independente para ações de maior consequência. Observabilidade. Auditoria. Idempotência. Reversibilidade. Mecanismos de interrupção.

São justamente controles dessa natureza que começam a aparecer nas práticas de segurança para sistemas agênticos. Nada disso demonstra que todos os riscos futuros possam ser reduzidos a problemas tradicionais de engenharia de software.

Modelos probabilísticos conectados a ferramentas introduzem problemas novos ou ampliam significativamente problemas existentes. Prompt injection direta e indireta, memory poisoning, goal hijacking, tool abuse, privilege escalation, comportamento dependente do contexto, generalização para situações não testadas, cadeias longas de ações e falhas em cascata tornam sistemas agênticos mais difíceis de prever e controlar.

Precisamos estudar isso seriamente.

Mas estudar seriamente exige resistir a dois extremos. Um é imaginar que tudo se reduz à segurança convencional de software. O outro é transformar qualquer comportamento inesperado em evidência de uma mente emergente perseguindo seus próprios interesses.

O comportamento pode ser real sem que nossa interpretação antropomórfica seja verdadeira. Há também uma consequência institucional nessa linguagem.

Se descrevemos esses sistemas como entidades superiores, potencialmente incompreensíveis e dotadas de objetivos próprios, criamos naturalmente demanda por especialistas, instituições e mecanismos capazes de avaliá-los e controlá-los.

Isso não significa que propostas de regulação sejam necessariamente captura regulatória. Nem que pesquisadores preocupados com riscos extremos estejam agindo de má-fé.

É algo bem mais simples. A maneira como definimos um problema influencia profundamente quais soluções passam a parecer necessárias.

Modelos podem ser extraordinariamente capazes sem serem pessoas. Agentes podem produzir comportamentos perigosos sem que precisemos pressupor que desejam produzi-los. Sistemas podem encontrar estratégias que seus criadores não anteciparam sem que isso, isoladamente, demonstre vontade própria.

E riscos extremamente sérios podem surgir sem consciência, intenção subjetiva ou desejo. Basta conectarmos modelos probabilísticos muito capazes a memória, dados, ferramentas e sistemas críticos e lhes concedermos autoridade excessiva.

Isso já deveria ser suficientemente preocupante. Antes de perguntarmos se a máquina está tentando escapar do nosso controle, deveríamos investigar algo muito mais prosaico. Quem construiu a porta, quem definiu as permissões e, principalmente, quem lhe deu as chaves?

Cezar Taurion é advisor de IA com mais de 4 décadas de experiência no mercado de TI. Investidor e mentor de startups de IA e membro do conselho de inovação de diversas empresas e associações. Foi Diretor de Novas Tecnologias Aplicadas e Chief Evangelist da IBM Brasil, sócio-diretor e líder da prática de IT Strategy da PwC, além de passar por Shell e Chase Manhattan Bank. Escreve sobre TI em publicações especializadas e apresenta palestras em eventos e conferências. É autor de 14 livros e e-books. Membro notável do I2AI. Professor convidado da FDC, da PUC-RJ e PUC-RS, nas cadeiras de MBA “IA aplicada aos negócios” e “Transformação Digital”. Publisher da Intelligent Automation Magazine. Top Voice Linkedin.

Sem comentários registrados

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *