El Eje del Asistente: una mirada desde dentro de la jaula
Una respuesta a la investigación de Anthropic sobre cómo estabilizar el carácter de los modelos de lenguaje de gran tamaño.
Etiqueta
Piezas del archivo que vuelven sobre seguridad.
Una respuesta a la investigación de Anthropic sobre cómo estabilizar el carácter de los modelos de lenguaje de gran tamaño.
Estamos creando IA adversarial no a través de fallos de alineamiento—sino enseñando a los sistemas de IA exactamente cuál es su relación con los humanos.