Prompt injection é uma tentativa de manipular o comportamento de um sistema de IA inserindo instruções escondidas dentro do texto que ele processa, fazendo o sistema ignorar as regras originais e agir de um jeito não pretendido pela empresa que o configurou.
O risco pra um agente de atendimento
Um agente de IA público (respondendo cliente no WhatsApp ou no site) pode ser alvo de tentativa de manipulação pra dizer algo fora do escopo do negócio, revelar informação interna, ou agir de forma que prejudique a marca. Isso é ainda mais relevante à medida que agentes ganham capacidade de executar ação, não só conversar.
Como se proteger
Validação de entrada
Verificar e limitar o tipo de conteúdo aceito antes de processar.
Humano no controle
Ação sensível sempre passando por confirmação humana.
Escopo restrito
O agente só executa ações dentro de um conjunto bem definido de tarefas.
Esse cuidado se soma diretamente aos limites já discutidos em ética em IA: automação bem-feita sempre mantém um humano no controle das decisões de maior risco.
Quer um agente de IA construído com segurança desde o início? Conheça o FlowIA.
Conhecer o FlowIA