RSS Amplifier

Sûreté de l'IA · Jan 6, 2024

Newsletter Sûreté de l’IA #28 : Bilan de l’année 2023

0
Sign in to vote or save

EffiSciences · Sûreté de l'IA

Bienvenue dans la traduction française de l’AI Safety Newsletter produite par le Center for AI Safety, et traduite par EffiSciences. Nous discutons ici des évolutions de l'IA et de la sûreté de l'IA. Aucune connaissance technique n'est requise.

Alors que l'année 2023 touche à sa fin, nous tenons à vous remercier pour votre soutien continu à la sûreté de l'IA. L'année écoulée a été une grande année pour l'IA et pour le Center for AI Safety. Dans cette édition spéciale de notre newsletter, nous mettons en lumière certains de nos projets les plus importants de l'année. Merci de contribuer à notre communauté et à notre travail.

Le Center for AI Safety (CAIS) se donne pour mission de réduire les risques sociétaux liés à l'IA. Nous pensons que cela passera par la recherche et par la réglementation. Ces deux éléments doivent être mis en œuvre rapidement (en raison des échelles de temps inconnues concernant les progrès de l'IA) et en tandem (car l'un ou l'autre seul serait insuffisant). Pour y parvenir, nous organisons notre travail autour de trois piliers : la recherche, le développement du domaine de la sûreté de l'IA (field-building), et la sensibilisation en faveur de la sûreté de l’IA.

Le CAIS mène des recherches techniques et conceptuelles sur la sûreté de l'IA. Nous poursuivons de multiples stratégies qui se chevauchent, et qui peuvent être combinées pour atténuer les risques ("défense en profondeur"). Bien qu'aucune approche ne permette à elle seule de réduire le risque à zéro, nous cherchons à construire des défenses superposées qui réduisent les risques à un niveau négligeable, tel qu’illustré par le “modèle du fromage suisse” ci-dessous.

Voici quelques éléments clefs de notre recherche technique en 2023 :

  • LLM Attacks : article qui démontre la possibilité de contourner de manière automatisée les garde-fous de sûreté sur GPT-4, Claude, Bard et Llama 2, ce qui entraîne un comportement dangereux des modèles, fournissant par exemple des instructions pour la construction d'une bombe. Ces travaux ont donné naissance au domaine des attaques adverses automatiques (automatic adversarial attacks) pour les LLM. L’article a été couvert par le New York Times.

  • Representation Engineering : un article introduisant une approche pour contrôler les modèles de l’intérieur pour les amener à mentir ou à être honnêtes. Les expériences montrent que ces méthodes peuvent rendre les IA plus honnêtes, plus averses au pouvoir et plus éthiques.

  • Benchmark MACHIAVELLI : un environnement de test (regroupant plusieurs jeux qui forcent l’agent à faire des choix, à la manière d’un “livre dont vous êtes le héros”), qui permet de tester la capacité d’une IA à prendre des décisions éthiques. Le benchmark fournit 13 mesures de comportement éthique sur la tromperie, le respect des règles, la recherche de pouvoir et l'utilité. Publié en tant qu'article oral à ICML 2023.

Nos chercheurs aident de nombreux laboratoires, tels que OpenAI et Meta, à réaliser des tests d’intrusion de type red-teaming (simulation d’attaque par des hackers) sur leurs modèles.

Nous avons également mené de la recherche conceptuelle sur la sûreté de l'IA : 

En s'appuyant sur son expertise en matière de recherche, le CAIS a aidé à organiser la compétition NeurIPS 2023 sur la détection des chevaux de Troie, qui comprenait un nouveau volet sur les tests d’intrusion sur les modèles de langage à grande échelle. Plus de 125 équipes ont participé et ont soumis plus de 3400 propositions. 

Le CAIS vise à créer un écosystème de recherche prospère qui permettra de progresser vers une IA sûre. Nous avons poursuivi cet objectif en 2023 en fournissant de l’infrastructure de calcul aux chercheurs en IA, en créant des ressources éducatives pour se familiariser avec le domaine, et en menant d'autres activités. 

Cluster de serveurs. Pour mener des recherches utiles sur la sûreté de l'IA, il faut souvent travailler avec des modèles de pointe, mais l'exécution de modèles à grande échelle est coûteuse et fastidieuse. Ces difficultés empêchent souvent les chercheurs de poursuivre des recherches avancées sur la sûreté de l'IA. En février 2023, le CAIS a lancé une cluster de serveurs pour fournir gratuitement de la puissance de calcul aux chercheurs travaillant sur la sûreté de l'IA.

À compter de novembre 2023, nous avons accueilli environ 200 utilisateurs travaillant sur 63 projets de sûreté de l'IA. Au total, 32 articles ont été produits à l'aide du cluster de serveurs du CAIS, notamment : 

70 % des laboratoires qui ont répondu à notre enquête auprès des utilisateurs ont indiqué que leur projet de recherche n'aurait pas été possible dans sa portée actuelle sans le cluster de serveurs ; les 30 % restants ont répondu qu’il accélérait considérablement leurs progrès en matière de recherche.

Bourse de recherche en philosophie. Cette année, le CAIS a accueilli une douzaine de philosophes universitaires pour un fellowship de sept mois. Ils ont produit 21 papiers de recherche sur la sûreté de l'IA, sur des sujets tels que les IA en quête de pouvoir (power-seeking AI) et le statut moral des IA, ainsi que d'autres sujets (voir ici). Ils ont également préparé trois ateliers dans le cadre de conférences philosophiques de premier plan, deux livres, plusieurs articles d'opinion et un numéro spécial d'une revue scientifique de premier plan (qui a reçu plus de 30 articles de recherche), tous axés sur la sûreté de l'IA. Cela accélère considérablement le développement de la sûreté de l'IA en tant qu'entreprise interdisciplinaire.

Événements. Le CAIS a réuni 20 juristes universitaires, chercheurs en politiques publiques, et décideurs politiques pour un atelier de trois jours sur le droit et la sûreté de l'IA. Un groupe de participants a ensuite fondé un consortium de juristes intéressés par la sûreté de l'IA. Ils ont également travaillé sur un recueil de programmes de recherche, qui sera bientôt publié. Parmi les répondants à notre enquête, 100 % des chercheurs sont repartis avec de nouvelles idées de recherche ; 91 % ont déclaré avoir trouvé l'atelier très utile pour rencontrer des collaborateurs de recherche.

Nous avons contribué à l'organisation d’évènements sociaux sur la sûreté du machine learning à l'ICML et au NeurIPS, deux grandes conférences sur l'IA, et environ 300 chercheurs se sont présentés à chacune d’elles pour discuter de la sûreté de l'IA. Nous avons participé à la plus grande conférence sur l'IA en Chine, la World AI Conference à Shanghai, où nous avons animé des discussions sur la sûreté de l'IA qui ont été suivies par plus de 30 000 personnes.

Manuel. An Introduction to AI Safety, Ethics, and Society (Introduction à la sûreté, à l'éthique et aux impacts sociétaux de l'IA) est un nouveau manuel qui sera publié dans une revue universitaire au début de l'année prochaine. Il vise à fournir une introduction accessible et complète à la sûreté de l'IA en s'appuyant sur l'ingénierie de la sûreté, l'économie, la philosophie et d'autres disciplines. Les personnes souhaitant suivre un cours en ligne gratuit basé sur le manuel peuvent manifester leur intérêt ici

Cours en ligne. En outre, le CAIS a organisé deux cohortes en ligne d'introduction à la sûreté du machine learning, en utilisant un syllabus que nous avons développé l'été dernier. Ces programmes ont permis à environ 100 étudiants, chercheurs et ingénieurs de l'industrie de se familiariser avec la sûreté de l'IA.

La sensibilisation du public et la compréhension de la sûreté de l'IA peuvent encourager des solutions techniques et politiques bien informées. Le CAIS conseille les gouvernements et écrit publiquement afin de partager des informations sur la sûreté de l'IA.

Déclaration sur le risque de l'IA. Le CAIS a publié une déclaration sur le risque d'extinction par l'IA, qui a notamment sensibilisé le public et les gouvernements à l'ampleur et à l'importance des risques liés à l'IA. De manière cruciale, cette déclaration sur le risque de l’IA a ancré le risque d'extinction lié à l'IA dans la fenêtre d'Overton en tant que débat public acceptable.

La déclaration a eu un impact significatif sur la réflexion des principaux dirigeants aux États-Unis et au Royaume-Uni. Rishi Sunak a réagi directement à la déclaration sur le risque de l'IA en déclarant que "le gouvernement [britannique] étudie très attentivement la question". Interrogée sur la déclaration, la porte-parole de la Maison Blanche, Karine Jean-Pierre, a déclaré que l'IA "est l'une des technologies les plus puissantes de notre époque. Mais pour saisir les opportunités qu'elle présente, nous devons d'abord atténuer les risques qu'elle comporte". Dans son discours sur l'état de l'Union, la présidente de la Commission européenne a cité la déclaration dans son intégralité.

La déclaration a été couverte par les médias, notamment le New York Times (couverture), The Guardian, BBC News, Reuters, The Washington Post, CNN, Financial Times, National Public Radio (NPR), The Times, Bloomberg et le Wall Street Journal.

Conseiller les décideurs politiques. Le CAIS a été l'un des principaux conseillers techniques travaillant avec le groupe de travail britannique (UK Task Force) sur le volet scientifique du UK AI Safety Summit. Nous avons répondu à la demande d'information de la NTIA en proposant un cadre réglementaire pour l'IA. Nous avons été invités à rejoindre l'Alliance pour la gouvernance de l'IA du Forum économique mondial et nous conseillons xAI, le département d'État britannique, le département d'État américain et d'autres organismes gouvernementaux. Enfin, le CAIS a contribué à lancer et à conseiller un fonds de subvention de 20 millions de dollars sur la sûreté de l'IA de la National Science Foundation.

Communication et médias. Le public a besoin d'informations précises et crédibles sur la sûreté de l'IA. Le CAIS vise à répondre à ce besoin grâce à ses deux newsletters qui comptent plus de 7 500 abonnés et à ses articles publiés dans des journaux tels que TIME et le Wall Street Journal. En dehors des engagements liés à la récente déclaration sur la sûreté de l’IA, le CAIS a eu plus de 50 engagements médiatiques majeurs. Le directeur du CAIS, Dan Hendrycks, a été nommé l'une des 100 personnes les plus influentes dans le domaine de l'IA par Time.

Un certain nombre de projets devraient être lancés en 2024. Au cours des prochains mois, ces projets visent à contenir les biorisques catastrophiques, à renforcer la coordination internationale et à mener des recherches techniques pour mettre en place des normes et des réglementations en matière de sûreté.

2023 a été une année importante et 2024 s'annonce encore plus cruciale. Votre don déductible des impôts [si vous travaillez aux Etats-Unis] rend notre travail possible. Vous pouvez soutenir la mission du Center for AI Safety, qui consiste à réduire les risques sociétaux de l'IA, en faisant un don ici.

Voir aussi : le site du CAIS, le CAIS sur Twitter, Une newsletter technique sur la recherche en sûreté et Un aperçu des risques catastrophiques liés à l’IA.

Aucun post

Read the original on effisciences.substack.com

Comments

Nothing yet. Say the first thing.

    Sign in to join the conversation.