10/08/2026 | Press release | Distributed by Public on 10/08/2026 10:36
Le récit de la Chine de Xi Jinping dépasse les frontières nationales et s'est désormais frayé un chemin jusque dans les versions les plus récentes de certains agents conversationnels occidentaux, comme ChatGPT ou Claude. La chercheuse américaine Hannah Waight, de l'université de l'Oregon, a dirigé une étude sur ce sujet.
Hannah Waight est professeure adjointe de sociologie à l'université de l'Oregon. Ses recherches portent sur les médias, l'information et les régimes autoritaires, notamment dans le cadre d'une récente étude publiée dans Nature sur la manière dont les médias contrôlés par l'État peuvent influencer les grands modèles de langage. Lire l'étude ici.
Votre étude a mis en évidence l'infiltration de la propagande chinoise dans les grands modèles de langage occidentaux les plus récents. Comment est-ce possible ?
Lorsque l'on réfléchit aux grands modèles de langage et à la politique, l'attention se porte largement sur deux mécanismes par lesquels des institutions puissantes peuvent façonner ces modèles. Le premier est la régulation. Lorsque DeepSeek, un agent conversationnel chinois développé par l'entreprise du même nom, a été lancé, par exemple, beaucoup se sont demandé s'il ne se contentait pas de répéter le discours de l'État, puisque la Chine exerce un certain degré de contrôle réglementaire sur le modèle. Une autre préoccupation, qui est liée, concerne la manière dont des organisations peuvent façonner leurs modèles à leur gré - l'exemple étant ici Grok, l'agent conversationnel intégré au réseau social X. De nombreuses personnes craignent qu'Elon Musk, propriétaire de l'entreprise qui a créé ce modèle, n'exerce sur lui une influence idéologique. Ces processus sont importants et méritent l'attention du monde universitaire et des médias. Mais ce que nous étudions véritablement ici, c'est un troisième mécanisme grâce auquel des institutions puissantes façonnent les réponses de ces modèles par la maîtrise de l'environnement informationnel lui-même.
La Chine a consacré beaucoup d'efforts à contrôler ce qui se trouve sur l'Internet chinois, au moyen de mécanismes de propagande et de censure qui favorisent certains contenus. Depuis le milieu ou la fin des années 2000, des efforts ont été entrepris pour archiver ce qui se trouve sur le Web - par l'intermédiaire d'initiatives telles que Common Crawl, une organisation à but non lucratif qui explore le Web afin de fournir des bases de données en libre accès regroupant des contenus en ligne - ces initiatives ont, en substance, aspiré toutes ces données, y compris celles provenant de l'Internet chinois. Depuis la fin des années 2010 environ, ces données ont été réutilisées pour entraîner de grands modèles de langage. Dans notre article, nous soutenons que la présence, dans les données d'entraînement de ces modèles, de contenus issus de médias chinois contrôlés par l'État produit un effet sur leurs réponses : elle les rend plus favorables à la République populaire de Chine (RPC), en particulier lorsqu'on interroge ces modèles en chinois plutôt qu'en anglais, ou dans d'autres langues linguistiquement éloignées du chinois utilisées à titre de comparaison.
Ce qui s'est produit relève essentiellement d'une succession de conséquences involontaires : d'abord, la décision des médias d'État chinois d'intervenir dans l'environnement informationnel ; ensuite, celle des organisations à l'origine de ces archives de récolter ces contenus ; enfin - et c'est le plus déterminant -, la décision d'entreprises comme OpenAI et Anthropic de récupérer toutes ces données sur Internet, de les considérer comme un réservoir neutre de langue et de connaissances, puis de les utiliser pour entraîner leurs modèles.
Il s'agit donc davantage d'un effet secondaire que d'une stratégie délibérée des autorités chinoises ?
Nous ne disposons d'aucun élément prouvant que cela soit intentionnel de la part de l'État chinois. Cela n'aurait même pas de sens sur le plan logique, car une grande partie des données d'entraînement que nous avons examinées a été collectée avant que ces modèles n'existent. Ceci étant dit, notre étude met en lumière une possibilité préoccupante : maintenant que ce canal de diffusion existe, il modifie les leviers d'action des régimes autoritaires. Il leur donne une raison supplémentaire d'organiser leur environnement informationnel, car ils peuvent ainsi non seulement façonner les perceptions de leurs propres citoyens, mais aussi influencer les modèles qui jouent désormais un rôle de plus en plus important dans notre environnement informationnel.
Cela étant dit, ce phénomène ne concerne pas uniquement la Chine. Dans la dernière étude de notre article, nous apportons des éléments montrant qu'il se produit très probablement dans tout régime autoritaire qui consacre des efforts importants au contrôle des médias et présente également un degré élevé d'exclusivité linguistique - c'est-à-dire lorsque la langue principale du pays n'est presque exclusivement parlée que sur son territoire. Si le système chinois peut produire un tel effet, c'est notamment parce que très peu d'autres organisations puissantes exercent ce type de contrôle sur l'information en langue chinoise. Cela vaut également pour un certain nombre de régimes autoritaires, comme le Vietnam ou le Turkménistan où nous pensons que le même processus est à l'œuvre.
Que peut-on faire pour endiguer la diffusion de la propagande au sein des grands modèles de langage ?
C'est une question véritablement importante, à laquelle il n'existe pas de réponse directe et simple. Je voudrais revenir à ce que j'ai dit au début : le mécanisme lié à l'environnement informationnel n'est que l'une des différentes façons dont des institutions puissantes peuvent façonner ces modèles. La régulation en est une autre. L'une de mes préoccupations personnelles est de savoir si la régulation ne risque pas, à terme, d'être utilisée à des fins politiques, notamment aux États-Unis. Nous devons donc soigneusement évaluer les risques.
Cela étant dit, en tant qu'équipe d'auteurs, nous estimons que la transparence constitue une première étape essentielle. Nous avons besoin de plus d'informations sur les données utilisées pour entraîner ces modèles et sur la manière dont les choix faits par les entreprises les font évoluer au fil du temps. Cela est important pour les utilisateurs, afin qu'ils puissent choisir en connaissance de cause les modèles auxquels ils ont recours et les usages qu'ils en font. Cela est important pour les responsables politiques, afin qu'ils puissent comprendre ce que contiennent réellement ces systèmes extrêmement complexes. Et cela est important pour les organisations qui déploient de plus en plus souvent ces modèles en leur confiant des données sensibles : elles doivent connaître la provenance des informations sur lesquelles reposent leurs systèmes.
L'une des principales conclusions de notre article est que ce que font concrètement ces modèles revient à blanchir l'information, en la coupant de sa source. Nous devons réintroduire cette source. Toute personne utilisant ces modèles devrait pouvoir savoir d'où proviennent, en dernière instance, les informations qu'elle obtient. Cet idéal est toutefois bien plus facile à invoquer qu'à mettre en pratique dans des systèmes aussi complexes.