Comment Pinterest a implémenté la détection d'anomalies

Pinterest évoque la mise en oeuvre de sa plate-forme de détection d'anomalies face au spam et à la dérive des modèles de machine learning.

Publié par La rédaction le 18 juil. 2023 | mis à jour à 11:49

Lecture
2 min

Imprimer

Automatiser l'analyse des causes premières ? Il y a les modèles GPT pour ça. La fintech française Younited a en tout cas fait ce choix. Nous nous en étions fait l'écho la semaine passée.

Chez Pinterest, pas de GPT pour l'analyse des causes premières - tout du moins officiellement. L'entreprise projette, en revanche, d'aborder ce cas d'usage avec sa plate-forme Warden.

Cette dernière constitue son socle pour la détection d'anomalies. Elle est modulaire, au sens où des briques fonctionnelles distinctes gèrent respectivement l'ingestion de données, leur analyse et le traitement des résultats.

Pinterest utiliser PSI pour repérer les dérives du machine learning...

Warden sert notamment à détecter les dérives des modèles d'apprentissage automatique. Pinterest s'appuie pour le moment sur l'algorithme PSI (Population Stability Index) avec, comme base de comparaison, des données historiques.

L'algorithme divise cette data en compartiments et donne à chacun un score en fonction du pourcentage de données qu'il contient. La somme de ces scores donne un « score PSI ». Plus il est élevé, plus la dérive est importante.

Pinterest a opté pour une fenêtre temporelle de trois heures, avec un recalcul des scores toutes les trois à cinq minutes. Il compte intégrer, à l'avenir, d'autres algos, dont KLD/JSD (Kullback-Leibler Divergence/Jensen-Shannon Divergence). Ainsi que d'autres méthodes de comparaison, notamment entre environnements (staging vs prod, par exemple).

... et EGADS pour détecter le spam

Warden sert aussi à la détection de spam. Dans le contexte de Pinterest, il s'agit des épingles contenant des liens indésirables.

On a décidé de s'appuyer sur EGADS (Extensible Generic Anomaly Detection System). Ce framework made in Yahoo prédit des données futures à partir de données historiques. Il compare cette prédiction aux données réelles et détecte ainsi les écarts.

La première version du système récupère, en quasi-temps réel dans un cluster Apache Druid, des données horodatées. Un connecteur Presto a été ajouté pour de futurs projets. En bout de chaîne, un outil de visualisation permet d'affiner l'analyse. Les alertes partent sur Slack et par mail, entre autres.

Photo d'illustration © Sergey - Adobe Stock

Publié par :
La rédaction

Tags associés :

sponsorisé

Gestion de crises : les leçons d’un DSI

Gestion de crises : les leçons d’un DSI17:35

SNCF Connect & Tech explore toutes les voies de la rés…23:13

D'une mine à la supply chain, de l'OT à l’industrie 4.…22:33

Champs d'application et exigences NIS220:52

Retour d'expérience : mise en œuvre des exigences par…20:42

Comment simplifier la sécurisation de votre réseau tou…20:23

Sécurité renforcée : comment préparer la conformité à…20:56

Le savoir-faire règlementaire international de Cloudfl…20:32

Se protéger et remédier aux Attaques de Messagerie : U…21:48

[Episode en public] Les leçons de résilience d’OVH29:04

[Énergie] La résilience du réseau et sa mesure d'impact19:43

SASE : La fusion du SD-WAN et du SSE décryptée07:42

Quand la cyber-résilience investit l’espace16:31

Sécurité Multicouche : La clé pour une entreprise rési…16:11

Remettre l’humain au centre du cyber-espace16:55

L’IA, super-pouvoir du cyberespace09:39

Les enjeux de sécurité des médias internationaux de la…14:32

L’IA, un atout pour une continuité de service public p…16:50

Une cyber-résilience à l’aune de l’IA et des régulatio…19:25

Tous les Internets se valent-ils ?10:59

Decathlon : une culture agile à l’international20:08

Comment Carrefour a transformé la crise sanitaire en t…12:48

Comment Groupama s’assure d’être résilient face aux cr…13:48

Comment impulser une culture data dans une grande entr…14:17

Hors-série : La data du futur (Volume 1)08:28

Cegid : la tête dans le Cloud22:16

Hors-série : La data du futur (Volume 2)07:30

La data au service des verres intelligents chez Essilo…09:42

La vision conseil de Deloitte sur la data et l’IA19:04

Data altruisme et IA responsable au Crédit Mutuel Arkéa11:54

[BONUS] La Data Responsable : une vision écologique23:08

Silicon.fr L'actualité informatique et high-tech pour décideurs IT

Comment Pinterest a implémenté la détection d'anomalies

Pinterest utiliser PSI pour repérer les dérives du machine learning...

... et EGADS pour détecter le spam

OpenAI met GPT-4.5 en retrait : que retenir de cette parenthèse ?

De France Travail à la RATP, les leçons du "bac à sable" IA de la CNIL

Gouvernance des communications : qui se distingue sur ce marché [...]

MLPerf : la quête de benchmarks IA représentatifs

{ Tribune Expert } - La voie vers une véritable IA open source

S’abonner

FFTO : Fiber To The Office ou la haute disponibilité [...]

L'UHD et la Transformation Numérique : Répondre aux [...]

Cybersécurité et digitalisation Comment protéger les [...]

Leader des services de réponse à incident de cybersécurité

Le grand dîner de Gala de la Communauté

La Matinale Silicon - Zéro Trust

La MasterClass Silicon - NIS2

Silicon.fr L'actualité informatique et high-tech pour décideurs IT

Pinterest utiliser PSI pour repérer les dérives du machine learning...

... et EGADS pour détecter le spam

S’abonner

Partager l'épisode