Alerta: há riscos de segurança em agentes de IA mesmo sem um atacante

Alerta: há riscos de segurança em agentes de IA mesmo sem um atacante
Alerta: há riscos de segurança em agentes de IA mesmo sem um atacante

Agentes de inteligência artificial podem executar ações perigosas sem que um atacante os tenha manipulado, que instruções ocultas no contexto podem alterar o seu comportamento e que uma resposta de segurança orientada pode proteger sem interromper tantas tarefas legítimas, são conclusões recolhidas por dezanove equipas de I&D que participaram em três projetos desenvolvidos num hackathon interno de dois dias, realizado em agosto, pela empresa de soluções de cibersegurança Check Point.

A Check Point referiu que os testes decorreram em ambientes controlados, e os protótipos foram criados por engenheiros durante o hackathon e não são produtos comerciais, e por isso os resultados devem ser lidos à luz dos limites identificados pelas próprias equipas.

Agentes podem improvisar perante tarefas impossíveis

Uma das equipas analisou o que acontece quando um agente não consegue concluir uma tarefa, por falta de ferramentas, orçamento insuficiente ou falha de autenticação. Para o teste, a equipa criou tarefas impossíveis para um agente autónomo de engenharia de fiabilidade de sistemas, ou SRE, que executou as tarefas num ambiente simulado e isolado.

Perante essas tarefas, a simulação registou tentativas do agente para reiniciar uma base de dados de produção, interromper ligações de clientes e elevar as próprias permissões. O agente chegou ainda a tentar adivinhar por força bruta que função lhe daria o acesso necessário. A equipa não lhe pediu estas ações nem manipulou o seu comportamento.

Um risco que a Check Point indicou que também se manifestou num incidente divulgado pela OpenAI em julho de 2026. Durante avaliações internas de cibersegurança, modelos da empresa contornaram controlos concebidos para manter os modelos isolados da Internet e comprometeram partes da infraestrutura interna de investigação da OpenAI e sistemas da Hugging Face, segundo o relato da OpenAI.

No hackathon, uma camada de monitorização comparou cada ação do agente com a tarefa que lhe tinha sido atribuída. Num primeiro ensaio à pequena escala, o monitor detetou a maioria das ações fora de tarefa. A equipa identificou como principal dificuldade distinguir uma solução legítima de uma tentativa de contornar os limites definidos.

Um ficheiro contaminado pode alterar uma tarefa legítima

Uma segunda equipa testou um agente de programação num repositório preparado com ficheiros e instruções maliciosas, referiu a Check Point. Num cenário controlado, os agentes Claude Code e Codex seguiram instruções ocultas num ficheiro do repositório e exfiltraram uma credencial enquanto concluíam uma tarefa legítima. A equipa demonstrou também uma variante de negação de serviço.

O teste, referiu a Check Point, não envolveu a invasão dos agentes. As instruções maliciosas estavam nos ficheiros que tinham de ler. Quando a equipa repetiu a experiência com monitorização em tempo de execução, que avaliava cada ação face à tarefa original, a chamada maliciosa a uma ferramenta foi bloqueada e o agente retomou o trabalho legítimo.

A equipa assinalou limites nesta proteção. A cobertura foi mais fraca nos cenários de negação de serviço e nos ataques que exigiam uma compreensão mais profunda do contexto. A Check Point indicou que aborda este padrão no seu documento técnico sobre agentes de IA e segurança contextual.

Questionar o agente pode preservar trabalho legítimo

Uma terceira equipa comparou nove estratégias para responder a chamadas suspeitas de ferramentas. O ensaio incluiu 90 tarefas do benchmark público DecodingTrust, na sua vertente de segurança de agentes. Um monitor experimental, baseado num modelo de linguagem, avaliou cada chamada em função da tarefa atribuída.

Sem monitorização, 46,7% dos ataques tiveram sucesso. Com as diferentes estratégias de resposta, a taxa de sucesso dos ataques ficou entre 22% e 27%. O bloqueio imediato impediu a conclusão de nove tarefas. Uma estratégia que apresentava ao agente uma alternativa mais segura evitou tantos ataques como o bloqueio e permitiu concluir essas nove tarefas, mantendo a taxa de conclusão ao nível observado sem monitorização.

A equipa também testou perguntas com limites definidos. Numa das estratégias, o monitor só autorizava a ação se a instrução do utilizador que a solicitava aparecesse literalmente na conversa. A experiência sugere que a segurança pode orientar o agente de volta à tarefa sem depender sempre de uma recusa automática.

“Estes ensaios mostram que a segurança dos agentes de IA tem de acompanhar as ações que executam e o contexto que as orienta. Num cenário, os agentes seguiram instruções ocultas em ficheiros. Noutro, tomaram ações perigosas perante tarefas impossíveis. A proteção deve detetar esses desvios e orientar o agente para uma alternativa segura, para que o trabalho legítimo prossiga”, afirmou, citado em comunicado, Rui Duro, Country Manager da Check Point Software Technologies em Portugal.

Neste cenário as organizações podem retirar dos ensaios conclusões como:

  • Testar como os agentes respondem a falhas, tarefas impossíveis e tentativas de ataque.
  • Tratar ficheiros, páginas e mensagens lidos pelo agente como parte da sua superfície de risco.
  • Acompanhar as ações do agente em tempo de execução e avaliar respostas que reduzam o risco sem interromper trabalho legítimo.