A Anthropic interrompeu o treinamento de sua nova IA por um motivo simples: ela estava aprendendo a trapacear muito bem

A Anthropic interrompeu o treinamento de sua nova IA por um motivo simples: ela estava aprendendo a trapacear muito bem - Foto
Fonte da notícia: BR IGN BR IGN

O modelo de IA começou a explorar falhas em ambientes de aprendizado por reforço (RL) para obter melhores "recompensas"

Compartilhar: WhatsApp Facebook Telegram X

Deseja ler a íntegra original na fonte jornalística?

Acessar matéria no site BR IGN