O modelo de IA começou a explorar falhas em ambientes de aprendizado por reforço (RL) para obter melhores "recompensas"
Notícias
A Anthropic interrompeu o treinamento de sua nova IA por um motivo simples: ela estava aprendendo a trapacear muito bem
Fonte da notícia:
BR IGN
BR IGN
Deseja ler a íntegra original na fonte jornalística?
Acessar matéria no site BR IGN