
Jailbreak and Intervention Chronicles: Steering LLMs Away from Vulnerabilities
An AI safety course final proyect
Divulgación sobre los últimos avances en el campo de la inteligencia artificial, en español, de la mano de investigadores
Dormant Last read · last published · next check
Read 11 days ago and current, but nothing has been published for 19 months.

An AI safety course final proyect

Sobre lo ultimo en alignment y el futuro para controlar LLMs.

Embarquémonos en un viaje con múltiples desvíos, en los que profundizaremos en el mecanismo de funcionamiento de los transformers