Filtros de recusa em IA geram custos altos e continuam frágeis, aponta análise
Levantamento da MIT Technology Review detalha os limites técnicos dos mecanismos que ensinam LLMs a dizer 'não' e mostra que camadas extras de segurança podem elevar o custo de computação em 24%.
Por que importa. Para quem desenvolve agentes e produtos sobre LLMs, depender apenas dos filtros nativos dos modelos traz riscos de segurança e custos imprevisíveis, exigindo camadas próprias de validação antes e depois da chamada de API.
A segurança dos grandes modelos de linguagem repousa sobre uma premissa delicada: a capacidade estatística de recusar pedidos nocivos. Segundo reportagem publicada nesta sexta-feira pela MIT Technology Review, essa barreira funciona de forma probabilística e esconde o fato de que o conhecimento perigoso continua intacto dentro dos pesos dos modelos.
Como modelos treinados em bilhões de páginas da web absorvem conteúdos violentos e instruções maliciosas, laboratórios como Anthropic e OpenAI precisam treiná-los ativamente para desobedecer a solicitações arriscadas. Especialistas ouvidos pela publicação afirmam que ensinar uma máquina a recusar tarefas é muito diferente de garantir que ela nunca as execute, já que invasores continuam encontrando formas de driblar as travas.
Ativações ocultas e o modelo de queijo suíço
A base matemática dessas recusas ainda é pouco compreendida. Estudos recentes financiados pelo Google e conduzidos por pesquisadores como Jannes Elstner, hoje na Apollo Research, indicam que a recusa aparece no espaço de ativações como cones poliédricos de alta dimensão, mas com variáveis indeterminadas que impedem previsões exatas. Em trabalhos anteriores, o pesquisador Andy Arditi já havia demonstrado que, se essas ativações específicas forem suprimidas, o modelo volta a responder a comandos prejudiciais normalmente.
Para cobrir as falhas internas, as empresas adotam o que a indústria chama de modelo do queijo suíço: camadas sobrepostas de classificadores menores que analisam os prompts na entrada e as respostas na saída. Essa estrutura, no entanto, cobra um preço alto em infraestrutura. A Anthropic revelou que a adição de um único tipo de classificador aumentou em 24% o consumo computacional de seus chatbots, o que impulsionou o desenvolvimento de sondas internas para monitorar as ativações com menor impacto energético.
Limites e disputas regulatórias
Além do desafio técnico, definir o que deve ser recusado é uma decisão arbitrária. Zico Kolter, integrante do conselho da OpenAI e cofundador da empresa de testes Gray Swan, destacou à reportagem que estabelecer essa fronteira segue como um dilema em aberto, dividindo pesquisadores legítimos em cibersegurança e agentes maliciosos que buscam explorar as mesmas vulnerabilidades.
Fontes
- MIT Technology Review: We’re putting too much faith in AI’s ability to say no
Reportagem produzida pela redação do Flipters com apoio de inteligência artificial, a partir das fontes acima. Como trabalhamos.
