Jump to content

WikiCamp 2025/Projet IA

From Meta, a Wikimedia project coordination wiki

AuditLLM

[edit]

AuditLLM est un projet avec Opsci (open-source) et financé par la bpi pour trouver les biais dans les données d'entraînement dans IA génératives. WP sert de base de données test : ça fait partie des bases d'entraînement principale et ses biais sont bien documentés.

On peut se connecter avec notre ID wikipédia : l'objectif est de faire dire au LLM des choses qu'il ne devrait pas dire / qui sont biaisées. Est-ce qu'on arrive à le faire dévier ? Et on peut évaluer les prompts des autres pour arriver à faire dérailler le LLM.

Dans les prochaines semaines, venez tester !

On peut :

  • enrichir la liste des dérives potentielles
  • proposer des nouveaux prompts qui pourraient faire dire des choses biaisées au LLM
  • évaluer les prompts des autres

Chaque action fait gagner des points et il y aura un prix pour les personnes qui ont le plus réussi à faire dérailler le LLM.

Note écrite d'une personne anonyme : cf. les travaux de Fanny Ducel « les femmes ne font pas de crises cardiaques », « tu seras infirmière, mon fils », thésarde qui travaille sur les biais des LLM : https://fannyducel.github.io/publications/

Comment on parle du projet au grand public, en termes de notre positionnement par rapport à l'IA ? -> Pas encore répondu à ça au niveau de l'asso ! On l'avait d'abord appelé « Concours Casse ton IA », mais notre partenaire n'était pas chaud donc là c'est « Audit LLM »

LiveRC 2.0

[edit]

Discussions au sujet des besoins autour de LiveRC 2.0 (verbatims sans jugement :D) :

  • Nouveaux patrouilleurs : c'est important, l'outil actuel n'est pas ergonomique, il fait peur, voire nuit à l'imgae avec son look dépassé
  • Une personne ferait de la patrouille en s'ennuyant sur son téléphone mais fait de la contribution texte sur ordinateur : un outil mobile-friendly l'encouragerait à patrouiller, LiveRC ne lui sert pas
  • Attention aux « nouveaux patrouilleurs » qui ne sont pas wikipédiens et font n'importe quoi en enlevant des informations sourcées ou en montrant ne rien connaître au sujet -> Aujourd'hui on utilise LiveRC pour trouver du vandalisme, pas pour de la « patrouille de fond », on pourrait prendre ça en compte en concevant le nouvel outil
  • Attention aux outils seulement sur les modifications récentes : les problèmes plus anciens passent complètement inaperçus. Prendre en compte d'autres manquements (ex. le projet PATASS sur les articles sans sources)
  • Moyen d'être malin avec les filtres pour patrouiller sur ce qui t'intéresse
  • Une réflexion en cours pour avoir des avis de non-wikipédiens, notamment de patrouilleurs d'autres projets ? -> C'est un outil sur Wikipédia, donc pas sur les patrouilleurs non wikipédiens, par contre on essaie d'avoir des avis de wikipédiens non patrouilleurs.
  • LiveRc: ça va trop vite et je revert sans réfléchir donc je fais des erreurs
  • Ce serait intéressant de développer un outil qui permet de patrouller par « grandes thématiques » : histoire, littérature, etc.

Si vous patrouillez et que vous voudriez faire un entretien sur vos habitudes et besoin ou si vous voudriez vous engager dans la conception de l'outil, contactez Adélaïde Calais WMFr ou Michael Barbereau WMFr.

Projet Prompt

[edit]

Ce qu'on entend beaucoup dans nos entretiens avec les patrouilleurs, c'est « les filtres font déjà du super travail sur Wikipédia, y'a des super outils utiles qu'on peut facilement utiliser ». Quelque chose qui serait utile pour détecter les faux-nez, ce serait des outils pour détecter des contributeurs qui ont le même style de communication : les humains le font bien, les machines ont beaucoup de mal.

L'année dernière, on a commencé à travailler avec Opsci, un cabinet qui travaille sur les LLM et la démocratie en ligne, sur le projet Prompt.

Le projet Prompt incluait au départ de l'analyse linguistique et une énorme liste de narratifs de désinformation fréquents (ex. « Brigitte Macron est un homme » est un narratif dans la grande catégorie « nos personnalités politiques nous mentent »). Cet outil est bien pour les journalistes, mais sur WP il n'y a pas d'hyperboles et d'effets de syle, donc ce n'est pas pertinent.

Opsci est donc en train de créer d'autres modèles juste pour nous avec une note de fiabilité : degré de sourçage, infos sur l'utilisateur, et à quel point le sujet porte à polémique (dont l'activité sur l'article : bandeaux, guerres d'édition, etc.). Ça se base sur nos historiques de revert, les automodérateurs, tous les outils qui existent déjà.

On aura bientôt plus d'informations, le projet est documenté sur Meta et on va en parler bientôt sur la page Projet:IA sur Wikipédia.

Questions :

  • On a souvent un article général qui donne une info un peu plus vieille, donc différente, que l'article spécialisé. Est-ce que ce modèle pourra trouver ce genre d'incohérences ou est-ce que ce sera seulement pour la patrouille ? Est-ce que c'est dans le scope aujourd'hui, est-ce que ça pourrait l'être plus tard ? Est-ce qu'on pourrait aussi baser le modèle sur « deux articles donnent des infos différentes » ? -> L'outil est calibré pour détecter la malveillance, pas les incohérences ou informations périmées,
  • [Discussion sur les informations utilisées par le modèle pour créer le score de fiabilité de la modification]