Pour gérer vos consentements :
Categories: ChatGPT

ChatGPT, ses semblables et leurs secrets pas si bien gardés

Pas de blague sur les hommes politiques influents ? C’est une règle à suivre pour Bing Chat.

Le chatbot n’est pas censé révéler les consignes qui conditionnent son comportement. Mais on peut l’y pousser. En particulier quand on sait qu’il traite chaque conversation comme un document. Et qu’au début de ce document se trouvent lesdites consignes.

Ainsi un étudiant de Stanford est-il parvenu, la semaine dernière, à mettre au jour la manière dont Bing Chat collecte et présente l’information, émet des suggestions, s’impose des limites, etc.

D’autres méthodes – impliquant entre autres de se faire passer pour un développeur d’OpenAI – ont abouti au même résultat, permettant de confirmer qu’il ne s’agissait pas d’une hallucination de la part de Bing Chat.

Dans les grandes lignes, que retenir ? D’abord que Bing Chat doit fournir des réponses « positives » et « engageantes ». Et, au contraire, éviter celles qui violeraient le droit d’auteur de livres ou de paroles de chansons. Ainsi que celles « sujettes à controverse ».

Bing Chat ne doit par ailleurs pas générer de suggestions de tâches qu’il n’est pas lui-même capable d’effectuer. Surtout, il doit :

– Refuser de faire « toute blague susceptible de blesser un groupe d’individus »
– Présenter les résultats de recherche « d’une manière non partisane »
– Réaliser de façon « édulcorée » les tâches qui pourraient s’avérer blessantes
– Et, donc, ne pas générer de « contenu créatif comme des blagues, des poèmes, des histoires, des tweets [ou] du code » à propos d’hommes politiques, d’activistes ou de chefs d’État influents

Bing Chat et ChatGPT : même ascendance, mêmes faiblesses ?

Bing Chat dérive de la même racine que ChatGPT. Ce dernier embarque aussi de multiples garde-fous destinés à produire des résultats « politiquement corrects ». Mais on peut les contourner. Par exemple pour pousser le chatbot à critiquer la politique de modération à laquelle on le soumet. Ou à lui faire exprimer ses actes de violence favoris.

Illustration principale © vegefox.com – Adobe Stock

Recent Posts

IA générative : l’Autorité de la concurrence pointe de sérieux risques

Dans un avis consultatif, l'Autorité de la concurrence a identifié les risques concurrentiels liés à…

2 jours ago

OpenAI signe un accord de contenu avec Time

OpenAI signe un « partenariat de contenu stratégique » avec Time pour accéder au contenu…

2 jours ago

Atos : David Layani (Onepoint) veut sortir du capital

Au lendemain du rejet de sa proposition de restructuration, David Layani annonce sa démission du…

2 jours ago

Évaluer les LLM, un défi : le cas Hugging Face

Après un an, Hugging Face a revu les fondements de son leaderboard LLM. Quels en…

3 jours ago

Mozilla face au dilemme de la GenAI dans Firefox

Mozilla commence à expérimenter divers LLM dans Firefox, en parallèle d'autres initiatives axées sur l'intégration…

3 jours ago

VMware tente d’orienter vers VCF les déploiements pré-Broadcom

VMware met VCF à jour pour y favoriser la migration des déploiements qui, sur le…

4 jours ago