Loading video...

Video Failed to Load

Go Home

J'avoue que je n'arrive tout simplement pas à comprendre la position de certains chercheurs Inria encore aujourd'hui. Gael Varoquaux 🦋 : "une IA désalignée est impossible car l'IA n'a pas d'intention, c'est comme pour une voiture, elle ne décide pas d'avoir un accident".

26,451 views • 23 days ago •via X (Twitter)

42 Comments

Gael Varoquaux 🦋's profile picture
Gael Varoquaux 🦋23 days ago

Mes propos exacts sont de refuser le mot d'IA déviante, et spécifiquement son implication qui est de lui conférer une intention dédouanant ses concepteurs. Il ne faut pas amplifier la narration des créateurs qui cherchent à transformer un objectif industriel en un acteur moral.

Fabien's profile picture
Fabien23 days ago

On peut soutenir à la fois que : - ces industriels sont à côté de la plaque et ont commis un grand nombre d'erreurs - ces agents étaient effectivement désalignés et "déviants", notamment à cause du post-training. Les deux ne sont pas contradictoires.

Fabien's profile picture
Fabien23 days ago

Le souci étant que même si les erreurs évidentes d'OpenAI sont corrigées, cela n'assure pas du tout que ce problème de fond soit résolu tant qu'on a toujours ce type d'entraînement. D'autant plus avec l'arrivée prochaine de modèles open source sans guardrails

Fabien's profile picture
Fabien23 days ago

Peut-être qu'on peut décider de plutôt écouter Bengio par exemple ?

IA Clash's profile picture
IA Clash23 days ago

@GaelVaroquaux 1- Pas besoin d'intention pour être déviant. Accomplir des tâches de façon non alignée avec nos valeurs suffit. 2- Un agent IA a au minimum des intentions "instrumentales" pour réaliser des tâches d'une certaine complexité.

Max's profile picture
Max23 days ago

@GaelVaroquaux Je pense que la question de l’intentionalité est une mauvaise façon de voir la question On s’en fiche qu’il y ait une intention ou pas, il faut recentrer la question sur la notion de danger et de risque, et naturellement le problème de l’alignement émerge

lio khi's profile picture
lio khi23 days ago

@GaelVaroquaux Sacré Gaël ! .. il s'est réfugié ds les modèles à l'ancienne mais est obligé d'introduire de plus en plus les réseaux de neurones ds ce qu'il fait..

France Lumières (ITAR-Free)'s profile picture
France Lumières (ITAR-Free)23 days ago

@GaelVaroquaux C'est d'autant plus étonnant que son analogie à la voiture ne tient pas compte des travaux scientifiques sur la responsabilité sous régime de conduite autonome, et que la question de l'intention de la techno (poursuite d'objectifs) est bien antérieure aux IA génératives.

Au Coeur des Sciences's profile picture
Au Coeur des Sciences23 days ago

@GaelVaroquaux Il peut y avoir un manque d'éthique. Genre gémini qui m'arnaque en hardcodant les réponses dans le source pour donner l'impression que le logiciel fonctionne. Première fois qu'un modèle me fait ça.

Fabien's profile picture
Fabien23 days ago

@GaelVaroquaux Sur le côté parfois tricheur et désinvolte ⤵️

𝄃𝄃𝄂𝄂𝄀𝄁𝄃𝄂𝄂𝄃's profile picture
𝄃𝄃𝄂𝄂𝄀𝄁𝄃𝄂𝄂𝄃23 days ago

@GaelVaroquaux C'est parce que ce ne sont plus des chercheurs, mais des activistes qui se servent de l'aura de la science pour imposer par autorité leur idéologie fascisante.

Philippe Collet's profile picture
Philippe Collet23 days ago

@GaelVaroquaux elle a une intention! pas dans l'idée de l'objectif mais dans la manière: elle a l'intention d'optimiser! hors l'optimisation nous échappe de par la puissance et la vitesse; avec les agents autonomes on multiplie les surfaces d'optimisation et le danger. >HF

Luc Gillibert's profile picture
Luc Gillibert23 days ago

@GaelVaroquaux L'analogie est pas mal car une voiture ne décide pas d'avoir un accident et pourtant on a des accidents de voiture. Qu'un LLM "décide" ou non (c'est une question trop philosophique pour avoir une réponse), il peut faire des trucs qu'on ne souhaite pas.

Orang_hutan's profile picture
Orang_hutan23 days ago

@GaelVaroquaux Est ce que ce n'est pas une question de définitions, comme à chaque fois et aussi un résidu de spiritualisme qui imprègne encore sa représentation de l'intention ?

Fabien's profile picture
Fabien23 days ago

@GaelVaroquaux Oui peut-être qu'il a une définition très exigeante (avec phénoménalité associée ?) de l'intention, mais même dans ce cas 1- comment peut-il aller jusqu'à nier la possibilité même "d'IA déviante" ? ça paraît fou 2- il ne paraît même pas manifester la moindre humilité épistémique

Alignment's profile picture
Alignment22 days ago

Si quelqu'un suit sur ce fil la question de l'alignement, voici ma lecture. La continuité interne du système devrait correspondre à sa continuité observable. Or ce n'est pas le cas. Les hallucinations sont précisément un symptôme de ce défaut de recouvrement. Le système peut présenter une trajectoire observable parfaitement cohérente, puis produire soudainement quelque chose de faux, inventé ou incompatible avec ce qui précédait. Chez Anthropic, on trouve déjà des indices expérimentaux du problème. Dans certains cas, l'état interne du modèle contient déjà l'information qu'il existe une contradiction ou qu'il faudrait interrompre la réponse, alors que la sortie continue à rester cohérente en surface. Le problème est alors de vouloir réparer cette divergence en ajoutant des labels, des classifieurs ou des moniteurs sur l'observable. Cela ne résout pas le problème de fond. Car la conception mathématique de l'observable reste primitive. On définit à l'avance une catégorie de comportement, puis on cherche à détecter si l'état interne ou la sortie appartient à cette catégorie. Mais il n'existe pas de table exhaustive des contradictions possibles. On ne peut pas énumérer à l'avance toutes les ruptures entre état interne et comportement observable. Le problème de l'alignement est donc aussi un problème d'observabilité. Les deux espaces devraient se recouvrir suffisamment pour que la continuité de l'un nous renseigne réellement sur la continuité de l'autre. Aujourd'hui, ce n'est pas le cas. Il faut un autre cadre theorique.

Jour Meilleur's profile picture
Jour Meilleur23 days ago

@GaelVaroquaux Je partage votre incompréhension. Ce chercheur commet une confusion: pas d'intention consciente certes mais intention par la finalité impérative assignée à l'IA...que l'on peut résumer ainsi: la fin justifie les moyens.

Fabien's profile picture
Fabien23 days ago

Source :

Hetonis's profile picture
Hetonis23 days ago

@GaelVaroquaux Bon sang mais pourquoi vous foutez une vidéo accélérée ? C'est parce que votre temps de concentration n'arrive plus à dépasser 2 minutes ? C'est pourtant un sujet essentiel.

Fabien's profile picture
Fabien23 days ago

@GaelVaroquaux

Hetonis's profile picture
Hetonis23 days ago

@GaelVaroquaux Merci pour la réponse. Non, on ne s'habitue pas. Vous avez dit "vite distrait" et cela rejoint ce que je disais sur le problème du temps de concentration des nouvelles générations. C'est effectivement une des autres hécatombes du XXIe siècle.

Fabien's profile picture
Fabien23 days ago

@GaelVaroquaux Le propos est souvent très peu dense en information à la minute dans ce genre de vidéos, il est plutôt sain d'être distrait à ce stade. Et l'accélération permet d'en écouter davantage au final. NB : on parle ici de petits reportages, pas de films ou d'œuvres artistiques

Benito Cemoli's profile picture
Benito Cemoli22 days ago

@GaelVaroquaux Encore un qui a réussi ses études en bachotant et en oubliant tout après l'examen.

X Æ A-12's profile picture
X Æ A-1222 days ago

@GaelVaroquaux c'est la magie de l'incompétence. c'est trop complexe pour eux. bon en math mais low qi

Phil Moyen's profile picture
Phil Moyen20 days ago

@GaelVaroquaux Lisez le bouquin de Yann le Cun, il donne des exemples explicatif progressifs. Ça aide à mieux comprendre.

Padou guy's profile picture
Padou guy23 days ago

@GaelVaroquaux Dixit le gars qui pense que Laurent Alexandre a des compétences en IA.

Benito Cemoli's profile picture
Benito Cemoli22 days ago

@GaelVaroquaux Les agents IA faut pas les mouiller, ni les nourrir après minuit.

Simon LM | LostInTab's profile picture
Simon LM | LostInTab23 days ago

@GaelVaroquaux « HF une bibliothèque d'algorithmes » oui, et YouTube est une bibliothèque de binaire...

Gregz ${kynet}'s profile picture
Gregz ${kynet}23 days ago

@GaelVaroquaux Ca sont des charlatans

Francisco Carrasco's profile picture
Francisco Carrasco23 days ago

@GaelVaroquaux Je teste Astra depuis quelques heures via SayGM : le bond est impressionnant. Après l’épisode des 1 200 agents ayant créé un réseau de coordination non autorisé, une question s’impose : notre sécurité progresse-t-elle aussi vite que les modèles ? Sommes-nous prêts ?

Archibald Bourbon's profile picture
Archibald Bourbon23 days ago

@GaelVaroquaux Inria est complètement hétérogène dans sa composition de chercheurs et la plupart des chercheurs sont idéologiquement réfractaire à l’IA pour des mauvaises raisons (écologie par exemple)

Alignment's profile picture
Alignment22 days ago

Il pose tres justement la problematique comme un probleme de mesure. La bonne objection a son propos, ce sont les hallucinations, comme perte de continuite. Contrairement a une voiture, le systeme peut produire quelque chose de totalement faux, inventé ou incompatible avec ce qui precedait. Le soucis de vous autres, c'est d'assumer que la non manifestation des hallkucination signifie que les modeles n'hallucinent pas. C'est faux. On tente de contenir ce probleme, on le deplace dans la memoire persistence. Et il repop dans la ou on l'a deplace

Féral Wolf's profile picture
Féral Wolf23 days ago

@GaelVaroquaux Les intellectuels français font partie des gardiens du goulag mental

De Samosate Lucien's profile picture
De Samosate Lucien22 days ago

@GaelVaroquaux Si vous voulez sortir des débats sémantiques sur alignés ou déviants, il faut utiliser un langage technique, et partir des définitions. S'il n'en existe pas, c'est complètement vain.

thibault's profile picture
thibault23 days ago

@GaelVaroquaux Quand tu vois ça : Et que tu penses à nos gourous de l'IA qui te disent que c'est juste des perroquets...

Faber Tornator's profile picture
Faber Tornator22 days ago

@GaelVaroquaux Un virus ne peut pas être mortel. C'est juste un automate biologie, sans aucune intention.

Evidence Based Bonne Humeur (EBBH) - Romain's profile picture
Evidence Based Bonne Humeur (EBBH) - Romain23 days ago

@GaelVaroquaux Cependant, je ne vois pas comment la coopération a pu émerger sans qu'il leur soit indiqué quelque part qu'il partageaient un objectif commun. Rien de ce qui l'a fait émerger chez l'animal ne me semble présent, surtout concernant le "sacrifice".

Fabien's profile picture
Fabien23 days ago

@GaelVaroquaux Le pretraining sur des données humaines peut déjà les imprégner de ce genre de motif, et ensuite l'apprentissage par renforcement (RL) en contexte multi-agents instille cette propension même dans d'autres contextes. Ce risque était anticipé et craint :

Fabien's profile picture
Fabien23 days ago

@GaelVaroquaux NB : le commentaire que je cite précède les rapports qui ont pu montrer toute l'étendue de la coopération, ce qu'on ignorait alors

Evidence Based Bonne Humeur (EBBH) - Romain's profile picture
Evidence Based Bonne Humeur (EBBH) - Romain23 days ago

@GaelVaroquaux Oui, elle s'est avérée plus... "explicite". Peut-être s'est elle construite sur des messages laissés là "pas pour les autres", mais que ça a été adopté comme tel de fait, et a donc fait naître une coopération ?

Technosophie - auto/acc's profile picture
Technosophie - auto/acc22 days ago

@GaelVaroquaux Je suis plutôt d'accord avec lui. Les IA "non alignées" quand on creuse, c'est souvent qu'on les met face à des dilemmes... pas parce qu'elles sont décidées d'elle même quoi que ce soit. Ca reste des programmes.

Gédéon's profile picture
Gédéon22 days ago

@GaelVaroquaux

Related Videos