RSS Amplifier

(in)sécurité, par Jean-Philippe Décarie-Mathieu · Aug 28, 2025

En amour comme en affaires, l'IA ne livre pas la marchandise

0
Sign in to vote or save

Jean-Philippe Décarie-Mathieu · (in)sécurité, par Jean-Philippe Décarie-Mathieu

Hola. Je suis de retour de vacances passées en Gaspésie avec une haine fraiche et renouvelée envers la bulle de l’intelligence artificielle et toutes les catastrophes annoncées qui entourent cette industrie délétère. LET’S DO THIS.

Mais avant de commencer, j’aimerais revenir sur le volet “le peuple à parlé” de mon sondage d’il y a deux semaines. Les résultats:

C’est clair en j’en prends bien note! Alors suivant ça, je vous annonce que cette infolettre va dorénavant uniquement couvrir le mariage (et futur divorce) de Travis Kelce et Taylor Swift.

C’T’UNE BLAGOUNETTE. En fait, cette édition de mon infolettre sera entièrement consacrée à cet immense théâtre qu’est l’industrie de l’intelligence artificielle et ses plus récents risques/débilités associées. Pis ça tombe bien parce qu’il manque pas de mauvaises nouvelles reliées aux LLMs depuis deux semaines.

Have phun.

Finalement, j’ai décidé de pas utiliser cette image comme encrage visuel de cette infolettre parce que c’était juste trop poche.

Est-ce qu’on serait en train de voir les balbutiements d’un pétage de cette gargantuesque bulle gonflée par des bonimenteurs sans scrupules, des politiciens dépassés par les événements, des hommes d’affaires crédules et par des techbros poudrés aux égos surdimensionnés?

Mark Zuckerberg a déjà commencé à “restructurer” sa division de recherche applicative sur l’intelligence artificielle à Meta:

Some A.I. executives are expected to leave, the people said. Meta is also looking at downsizing the A.I. division overall — which could include eliminating roles or moving employees to other parts of the company — because it has grown to thousands of people in recent years, the people said.

De plus, selon un recensement par le MIT de 300 projets d’implantation d’IA/LLM en entreprise, la quasi-totalité des projets pilotes utilisant des grands modèles de langage échouent à ramener quelconque forme de retour sur investissement:

While executives often blame regulation or model performance, MIT’s research points to flawed enterprise integration. Generic tools like ChatGPT excel for individuals because of their flexibility, but they stall in enterprise use since they don’t learn from or adapt to workflows, Challapally explained.

Le déploiement agentic (j’haïs ce néologisme) semble fonctionner quand un LLM s’attaque à un problème très spécifique dans une entreprise mais ne sert pas à grand chose quand c’est des bonzes déconnectés qui veulent juste surfer sur la vague d’intelligence artificielle “parce que les compétiteurs le font, eux”. Dur à croire, hein!

:-D

C’est d’ailleurs un bon moment de nous rappeler collectivement que l’intelligence artificielle n’en est pas une, intelligence. Les LLMs ne raisonnent pas - ils régurgitent des phrases basées sur une interprétation sommaire de ce qu’ils ont dans leur dataset. Quand on leur demande d’extrapoler au delà du modèle d’entrainement, c’est des échecs systématiques:

As the researchers hypothesized, these basic models started to fail catastrophically when asked to generalize novel sets of transformations that were not directly demonstrated in the training data. While the models would often try to generalize new logical rules based on similar patterns in the training data, this would quite often lead to the model laying out "correct reasoning paths, yet incorrect answer[s]." In other cases, the LLM would sometimes stumble onto correct answers paired with "unfaithful reasoning paths" that didn't follow logically.

Les LLMs sont des outils de génération de code sur demande, certainement pas, genre, des conjoints idéalisés… ou des thérapeutes. RIP Adam Raine. Souvenez-vous en, de grâce.

Même pour de la révision d’articles de base, les LLMs sont tellement imprévisibles dans la qualité de ce qu’ils produisent qu’ils deviennent presque un handicap. L’implantation de l’intelligence artificielle dans la gestion des articles et modifications proposés sur Wikipédia est d’ailleurs à l’origine d’un désaccord entre Jimmy Wales et certains éditeurs de la fameuse encyclopédie en ligne. Un article (avec un titre un peu clickbait-y) de 404 Media en parle:

For example, the response suggested the article cite a source that isn’t included in the draft article, and rely on Harvard Business School press releases for other citations, despite Wikipedia policies explicitly defining press releases as non-independent sources that cannot help prove notability, a basic requirement for Wikipedia articles.

(Article complet non-paywallé disponible ici.)

Full disclosure: initialement, j’avais essayé d’utiliser ChatGPT pour m’aider à la rédaction et, surtout, la synthèse d’articles pour mon infolettre mais j’ai eu ces mêmes problèmes: le LLM inventait ou omettait des sources, donnait des résumés factuellement incorrectes, ignorait carrément certains articles, etc. Bref, trop plate dans sa rédaction de textes et pas fiable pour le volet factuel.

Bellingcat a effectué des tests de benchmark sur plusieurs LLMs afin de tester leur capacité à trouver de l’information en sources ouvertes (OSINT) à partir de certaines images. GPT-5 de OpenAI - le plus récent modèle qui ne cesse de décevoir - n’a pas obtenu une note stellaire. Un extrait de l’article, question de bien taper sur le même clou:

The majority of models, at some point, returned a hallucination. Users should not rely solely on the answers provided by LLMs. Even the best options, including Google AI Mode, still, at times, confidently point to the wrong location.

Haiku 3.5 de Claude a eu le pire résultat, ceci dit. Je peux pas JUSTE varger sur OpenAI, quand même.

Ce gars est très punchable.

Comet, le navigateur agentic (argh) de Perplexity AI est vulnérable à des attaques de prompt injection contenant des instructions malicieuses insérées dans des publications Reddit. Les instructions en question doivent être, préférablement, dissimulées dans une publication standard via le tag “Spoilers”; l’utilisateur devient alors une victime en utilisant la fonction “Summarize the current web page” (pour ceux ayant une capacité d’attention comparable à un poisson rouge), qui exécute les instructions en question.

C’est Brave qui a révélé cette faille. C’est important de noter que Brave, qui est un compétiteur direct à Comet, se sont clairement gâtés avec ça mais ils ne sont pas sans squelettes dans leur placard.

La bonne nouvelle, c’est que personne n’utilise Comet.

Des chercheurs en cybersécurité ont découverts que le chatbot IA utilisé par McDonald’s pour le recrutement, “Olivia” (parce que c’est extrêmement important d’anthropomorphiser ces clankers la, bien sûr), protège sa base de données de candidats avec un mot de passe qui est un véritable classique: ‘123456’. Et oui:

Until last week, the platform that runs the Olivia chatbot, built by artificial intelligence software firm Paradox.ai, also suffered from absurdly basic security flaws. As a result, virtually any hacker could have accessed the records of every chat Olivia had ever had with McDonald's applicants—including all the personal information they shared in those conversations—with tricks as straightforward as guessing the username and password “123456." […]

The data appears to include as many as 64 million records, including applicants' names, email addresses, and phone numbers.

AgEnTiC ViBe-CoDiNg~

Parce qu’il faut bien terminer cette infolettre en beauté, question de ne pas se vautrer éternellement dans le négativisme!

Forever alone.

L’outil de la semaine: TorFlow, qui donne une idée visuelle du trafic en temps réel sur le réseau Tor et qui irait très bien dans une grosse télévision dans un SOC. Ça me rappelle la vieille carte d’attaques de Norse mais en légèrement plus utile.

Fun facts: selon cette carte, il y a 90 nœuds Tor dans la grande région de Montréal et UN SEUL à Québec.

Pour les vieux de la vieille: Phrack #72 est sorti!

Bonne semaine!

Aucun post

Read the original on jpdm.substack.com

Comments

Nothing yet. Say the first thing.

    Sign in to join the conversation.