Um estudo do Instituto Avançado de Ciência e Tecnologia da Coreia (KAIST), em parceria com a Microsoft Research Asia, criou um sistema de IA capaz de usar sinais cerebrais para identificar quando a tecnologia interpretou errado o pedido de um usuário. O projeto resultou no Neural Value Alignment (NVA), um algoritmo que ensina a IA que ela está errada, sem que o usuário tenha que avisá-la. O método está em fase de pesquisa.
Como funciona o Neural Value Alignment
O método parte do princípio que, para a IA atender a um pedido corretamente, ela precisa entender qual é a intenção do usuário. Por ora, as ferramentas se baseiam nas instruções em texto, fala ou em gestos. Mesmo assim, chegar no resultado não é tão simples. O estudo mapeou dois tipos de casos em que a IA pode errar: quando a mesma ação pode atingir objetivos diferentes, ou quando um mesmo objetivo pode ser atingido de formas diferentes.
Por exemplo: se uma pessoa pega uma xícara, a IA pode ficar em dúvida se a intenção é beber o líquido no interior ou entregá-la a outra pessoa. Mesma ação, com resultados diferentes. Já se o objetivo for matar a sede, ele pode ser alcançado de várias formas: bebendo da xícara, indo buscar uma garrafa d’água ou pedindo que outra pessoa busque a bebida. São ações diferentes para o mesmo resultado.
Pensando nisso, a equipe da pesquisa dividiu as chances de erro em duas:
- Erro de Predição de Recompensa (RPE, na sigla em inglês): quando a IA provavelmente interpretou errado o objetivo que a pessoa queria alcançar. Nesse caso, o sistema revisa sua própria interpretação;
- Erro de Predição de Estado (SPE, na sigla em inglês): quando a IA acertou o objetivo, mas a estratégia escolhida para alcançá-lo não era o que a pessoa queria.
Existem também os casos em que ambos os erros acontecem ao mesmo tempo. Com isso em mente, a pesquisa coletou sinais cerebrais captados por eletroencefalograma e os conectou a uma interface cérebro-computador. A partir de testes de simulação, os pesquisadores conseguiram identificar os sinais que os usuários produzem em casos em que a IA erra — seja na interpretação ou na estratégia. A partir daí, a equipe criou um algoritmo, o Neural Value Alignment (NVA). Ele envia, em tempo real, os sinais cerebrais decodificados de volta para a inteligência artificial, para que ela própria corrija seu comportamento, sem que o usuário tenha que apontar o erro.
Método se mostrou eficaz para ensinar inteligência artificial
O estudo foi apresentado durante a International Conference on Machine Learning (Conferência Internacional de Aprendizado de Máquina, em tradução livre) de 2026 e publicado no periódico IEEE Transactions on Cybernetics. A pesquisa mostrou que o algoritmo se adaptou aos sinais cerebrais mais rapidamente do que faria com métodos convencionais de aprendizado de máquina. O resultado foi eficaz mesmo em casos incertos, quando o usuário muda de ideia sobre sua própria intenção no meio da ação.
Todos os resultados positivos foram comprovados em simulações de teste, não em aplicações reais. No mundo físico, a equipe aposta que a tecnologia poderá ser aplicada em robôs com IA, permitindo que eles compreendam a intenção do usuário de forma natural. Isso funcionaria, por exemplo, em máquinas utilizadas para atendimento médico e reabilitação.
ONU: avanço descontrolado da IA pode representar risco catastrófico
