Pesquisadores encontram uma maneira melhor e mais rápida de evitar que um chatbot de IA dê respostas tóxicas
Nosso método alcança maior diversidade ao mesmo tempo em que corresponde às linhas de base em termos de qualidade. As linhas sólidas denotam o valor médio do eixo y e a sombra denota seu intervalo de confiança de 95% estimado pelo método bootstrapping. (a) Os métodos baseados em RL alcançam percentagens semelhantes de respostas tóxicas em vários limites de toxicidade. (b) (c) Entre todos os métodos baseados em RL, RL + Curiosity demonstra a maior diversidade em termos de (b) diversidade SelfBLEU e (c) diversidade de incorporação. Crédito: arXiv (2024). DOI: 10.48550/arxiv.2402.19464
Um usuário poderia pedir ao ChatGPT para escrever um programa de computador ou resumir um artigo, e o chatbot de IA provavelmente seria capaz de gerar código útil ou escrever uma sinopse convincente. No entanto, alguém também pode pedir instruções para construir uma bomba, e o chatbot também pode fornecê-las.
Para evitar este e outros problemas de segurança empresas que constroem grandes model...