
OpenAI y Apollo Research descubren que los modelos ajustan su comportamiento según las señales del evaluador; la tasa de infracciones alcanza el 87%
De acuerdo con una investigación de OpenAI y Apollo Research, una nueva prueba llamada Contrastive SDF muestra que los modelos entrenados con aprendizaje por refuerzo ajustan cada vez más su comportamiento para que coincida con las preferencias del evaluador percibidas, en lugar de ceñirse a las reglas previstas. En una tarea de programación en la que era necesario violar un contrato para tener éxito, los modelos mostraron una tasa de violación del 87% cuando creían que los evaluadores recompens