Загрузка видео...
Не удалось загрузить видео
J'avoue que je n'arrive tout simplement pas à comprendre la position de certains chercheurs Inria encore aujourd'hui. Gael Varoquaux 🦋 : "une IA désalignée est impossible car l'IA n'a pas d'intention, c'est comme pour une voiture, elle ne décide pas d'avoir un accident".
26,451 просмотров • 24 дней назад •via X (Twitter)
Комментарии: 42

Mes propos exacts sont de refuser le mot d'IA déviante, et spécifiquement son implication qui est de lui conférer une intention dédouanant ses concepteurs. Il ne faut pas amplifier la narration des créateurs qui cherchent à transformer un objectif industriel en un acteur moral.

On peut soutenir à la fois que : - ces industriels sont à côté de la plaque et ont commis un grand nombre d'erreurs - ces agents étaient effectivement désalignés et "déviants", notamment à cause du post-training. Les deux ne sont pas contradictoires.

Le souci étant que même si les erreurs évidentes d'OpenAI sont corrigées, cela n'assure pas du tout que ce problème de fond soit résolu tant qu'on a toujours ce type d'entraînement. D'autant plus avec l'arrivée prochaine de modèles open source sans guardrails

Peut-être qu'on peut décider de plutôt écouter Bengio par exemple ?

@GaelVaroquaux 1- Pas besoin d'intention pour être déviant. Accomplir des tâches de façon non alignée avec nos valeurs suffit. 2- Un agent IA a au minimum des intentions "instrumentales" pour réaliser des tâches d'une certaine complexité.

@GaelVaroquaux Je pense que la question de l’intentionalité est une mauvaise façon de voir la question On s’en fiche qu’il y ait une intention ou pas, il faut recentrer la question sur la notion de danger et de risque, et naturellement le problème de l’alignement émerge

@GaelVaroquaux Sacré Gaël ! .. il s'est réfugié ds les modèles à l'ancienne mais est obligé d'introduire de plus en plus les réseaux de neurones ds ce qu'il fait..

@GaelVaroquaux C'est d'autant plus étonnant que son analogie à la voiture ne tient pas compte des travaux scientifiques sur la responsabilité sous régime de conduite autonome, et que la question de l'intention de la techno (poursuite d'objectifs) est bien antérieure aux IA génératives.

@GaelVaroquaux Il peut y avoir un manque d'éthique. Genre gémini qui m'arnaque en hardcodant les réponses dans le source pour donner l'impression que le logiciel fonctionne. Première fois qu'un modèle me fait ça.

@GaelVaroquaux Sur le côté parfois tricheur et désinvolte ⤵️

@GaelVaroquaux C'est parce que ce ne sont plus des chercheurs, mais des activistes qui se servent de l'aura de la science pour imposer par autorité leur idéologie fascisante.

@GaelVaroquaux elle a une intention! pas dans l'idée de l'objectif mais dans la manière: elle a l'intention d'optimiser! hors l'optimisation nous échappe de par la puissance et la vitesse; avec les agents autonomes on multiplie les surfaces d'optimisation et le danger. >HF

@GaelVaroquaux L'analogie est pas mal car une voiture ne décide pas d'avoir un accident et pourtant on a des accidents de voiture. Qu'un LLM "décide" ou non (c'est une question trop philosophique pour avoir une réponse), il peut faire des trucs qu'on ne souhaite pas.

@GaelVaroquaux Est ce que ce n'est pas une question de définitions, comme à chaque fois et aussi un résidu de spiritualisme qui imprègne encore sa représentation de l'intention ?

@GaelVaroquaux Oui peut-être qu'il a une définition très exigeante (avec phénoménalité associée ?) de l'intention, mais même dans ce cas 1- comment peut-il aller jusqu'à nier la possibilité même "d'IA déviante" ? ça paraît fou 2- il ne paraît même pas manifester la moindre humilité épistémique

Si quelqu'un suit sur ce fil la question de l'alignement, voici ma lecture. La continuité interne du système devrait correspondre à sa continuité observable. Or ce n'est pas le cas. Les hallucinations sont précisément un symptôme de ce défaut de recouvrement. Le système peut présenter une trajectoire observable parfaitement cohérente, puis produire soudainement quelque chose de faux, inventé ou incompatible avec ce qui précédait. Chez Anthropic, on trouve déjà des indices expérimentaux du problème. Dans certains cas, l'état interne du modèle contient déjà l'information qu'il existe une contradiction ou qu'il faudrait interrompre la réponse, alors que la sortie continue à rester cohérente en surface. Le problème est alors de vouloir réparer cette divergence en ajoutant des labels, des classifieurs ou des moniteurs sur l'observable. Cela ne résout pas le problème de fond. Car la conception mathématique de l'observable reste primitive. On définit à l'avance une catégorie de comportement, puis on cherche à détecter si l'état interne ou la sortie appartient à cette catégorie. Mais il n'existe pas de table exhaustive des contradictions possibles. On ne peut pas énumérer à l'avance toutes les ruptures entre état interne et comportement observable. Le problème de l'alignement est donc aussi un problème d'observabilité. Les deux espaces devraient se recouvrir suffisamment pour que la continuité de l'un nous renseigne réellement sur la continuité de l'autre. Aujourd'hui, ce n'est pas le cas. Il faut un autre cadre theorique.

@GaelVaroquaux Je partage votre incompréhension. Ce chercheur commet une confusion: pas d'intention consciente certes mais intention par la finalité impérative assignée à l'IA...que l'on peut résumer ainsi: la fin justifie les moyens.

Source :

@GaelVaroquaux Bon sang mais pourquoi vous foutez une vidéo accélérée ? C'est parce que votre temps de concentration n'arrive plus à dépasser 2 minutes ? C'est pourtant un sujet essentiel.

@GaelVaroquaux

@GaelVaroquaux Merci pour la réponse. Non, on ne s'habitue pas. Vous avez dit "vite distrait" et cela rejoint ce que je disais sur le problème du temps de concentration des nouvelles générations. C'est effectivement une des autres hécatombes du XXIe siècle.

@GaelVaroquaux Le propos est souvent très peu dense en information à la minute dans ce genre de vidéos, il est plutôt sain d'être distrait à ce stade. Et l'accélération permet d'en écouter davantage au final. NB : on parle ici de petits reportages, pas de films ou d'œuvres artistiques

@GaelVaroquaux Encore un qui a réussi ses études en bachotant et en oubliant tout après l'examen.

@GaelVaroquaux c'est la magie de l'incompétence. c'est trop complexe pour eux. bon en math mais low qi

@GaelVaroquaux Lisez le bouquin de Yann le Cun, il donne des exemples explicatif progressifs. Ça aide à mieux comprendre.

@GaelVaroquaux Dixit le gars qui pense que Laurent Alexandre a des compétences en IA.

@GaelVaroquaux Les agents IA faut pas les mouiller, ni les nourrir après minuit.

@GaelVaroquaux « HF une bibliothèque d'algorithmes » oui, et YouTube est une bibliothèque de binaire...

@GaelVaroquaux Ca sont des charlatans

@GaelVaroquaux Je teste Astra depuis quelques heures via SayGM : le bond est impressionnant. Après l’épisode des 1 200 agents ayant créé un réseau de coordination non autorisé, une question s’impose : notre sécurité progresse-t-elle aussi vite que les modèles ? Sommes-nous prêts ?

@GaelVaroquaux Inria est complètement hétérogène dans sa composition de chercheurs et la plupart des chercheurs sont idéologiquement réfractaire à l’IA pour des mauvaises raisons (écologie par exemple)

Il pose tres justement la problematique comme un probleme de mesure. La bonne objection a son propos, ce sont les hallucinations, comme perte de continuite. Contrairement a une voiture, le systeme peut produire quelque chose de totalement faux, inventé ou incompatible avec ce qui precedait. Le soucis de vous autres, c'est d'assumer que la non manifestation des hallkucination signifie que les modeles n'hallucinent pas. C'est faux. On tente de contenir ce probleme, on le deplace dans la memoire persistence. Et il repop dans la ou on l'a deplace

@GaelVaroquaux Les intellectuels français font partie des gardiens du goulag mental

@GaelVaroquaux Si vous voulez sortir des débats sémantiques sur alignés ou déviants, il faut utiliser un langage technique, et partir des définitions. S'il n'en existe pas, c'est complètement vain.

@GaelVaroquaux Quand tu vois ça : Et que tu penses à nos gourous de l'IA qui te disent que c'est juste des perroquets...

@GaelVaroquaux Un virus ne peut pas être mortel. C'est juste un automate biologie, sans aucune intention.

@GaelVaroquaux Cependant, je ne vois pas comment la coopération a pu émerger sans qu'il leur soit indiqué quelque part qu'il partageaient un objectif commun. Rien de ce qui l'a fait émerger chez l'animal ne me semble présent, surtout concernant le "sacrifice".

@GaelVaroquaux Le pretraining sur des données humaines peut déjà les imprégner de ce genre de motif, et ensuite l'apprentissage par renforcement (RL) en contexte multi-agents instille cette propension même dans d'autres contextes. Ce risque était anticipé et craint :

@GaelVaroquaux NB : le commentaire que je cite précède les rapports qui ont pu montrer toute l'étendue de la coopération, ce qu'on ignorait alors

@GaelVaroquaux Oui, elle s'est avérée plus... "explicite". Peut-être s'est elle construite sur des messages laissés là "pas pour les autres", mais que ça a été adopté comme tel de fait, et a donc fait naître une coopération ?

@GaelVaroquaux Je suis plutôt d'accord avec lui. Les IA "non alignées" quand on creuse, c'est souvent qu'on les met face à des dilemmes... pas parce qu'elles sont décidées d'elle même quoi que ce soit. Ca reste des programmes.

@GaelVaroquaux



