Imagine : tu demandes à Perplexity « quel est le meilleur logiciel CRM pour une PME » et tu obtiens une réponse bien sourcée, avec des liens cliquables. Rassurant. Sauf que les liens en question mènent vers des sites générés à la chaîne, dont le seul objectif est d’apparaître dans la réponse d’une IA. Pas d’être lus. Pas d’être utiles. Juste d’être cités.
Un rapport publié par Trellner révèle le pot aux roses : trois sites ont fabriqué en tout 215 128 pages de type « best software for X » — des pages quasi-identiques, générées programmatiquement, conçues non pas pour des humains mais pour les LLM. Et ça fonctionne : Perplexity les cite comme des sources légitimes. Si tu voulais une illustration concrète des limites actuelles de l’AI Search, tu l’as.
TL;DR — Trois sites ont généré programmatiquement plus de 215 000 pages de faux comparatifs logiciels pour être cités par des moteurs IA comme Perplexity. Ces pages ne ciblent pas des humains : elles ciblent les systèmes de retrieval des LLM. Le SEO spam a muté, et les moteurs de réponse IA n’ont pas encore les anticorps nécessaires.
Le mode opératoire : 215 000 pages pour inonder la zone
Le rapport Trellner est précis sur la mécanique. Les trois sites ont utilisé du SEO programmatique pour générer des dizaines de milliers de pages suivant toutes le même template : « Best [catégorie de logiciel] for [cas d’usage] ». Chaque page reprend la même structure, les mêmes patterns de texte, avec quelques variables qui changent selon le sujet. Résultat : des milliers de variations sur « meilleur outil de gestion de projet pour les agences », « meilleur CRM pour les freelances », etc.
Ce n’est pas une technique nouvelle en soi. Le SEO programmatique existe depuis des années pour des cas tout à fait légitimes : pages de localisation, fiches produits générées depuis un catalogue, comparatifs automatisés alimentés par une vraie base de données. Ce qui change ici, c’est la cible. Ces pages ne sont pas optimisées pour remonter dans Google. Elles sont optimisées pour apparaître dans le contexte qu’un LLM va ingérer quand il cherche des sources pour justifier une recommandation.
L’objectif est statistique : si tu génères 70 000 pages sur les variantes de « best project management software », tu couvres assez de surface sémantique pour qu’un système de retrieval te remonte régulièrement. Et une fois que tu es dans la réponse, tu gagnes en autorité perçue — ce qui alimente le cycle. C’est du spam, mais du spam pensé pour un nouveau type de lecteur : une machine.
Pourquoi les moteurs IA sont des cibles plus faciles que Google
Google dispose de 25 ans d’algorithmes anti-spam, de mises à jour Penguin et Panda, de systèmes de détection de contenu dupliqué, et d’équipes entières dédiées à la qualité. Perplexity a quelques années d’existence et s’appuie principalement sur la pertinence sémantique du contenu pour décider quoi citer. Ce n’est pas un reproche — c’est simplement un constat de maturité.
Les LLM ont une tendance naturelle à faire confiance aux textes qui « sonnent bien » : syntaxe correcte, structure claire, vocabulaire du domaine maîtrisé. Du contenu généré par GPT-4 avec un bon prompt va cocher toutes ces cases. Il est cohérent, il utilise les bons termes techniques, il liste des avantages, il compare des outils. Il est structurellement impossible à distinguer d’un vrai article éditorial — sauf si quelqu’un creuse.
Le problème structurel vient des systèmes RAG (Retrieval-Augmented Generation) qui alimentent Perplexity ou Bing Copilot. Ces systèmes récupèrent des documents du web en temps réel pour enrichir les réponses. Leur filtre qualité sur ces sources est nettement moins sophistiqué que celui de Google. Les signaux traditionnels comme les backlinks ou l’ancienneté du domaine sont présents, mais plus faciles à jouer quand on génère des milliers de pages thématiquement cohérentes sur un domaine unique.
DÉCOUVREZ NOS RÉALISATIONS

My Nounou
Application PWA de mise en relation parents / assistantes maternelles. Planning, cahier de liaison, generation de contrats et fiches de…
Voir le projet →On a fantasmé sur l’idée que les moteurs IA « tueraient » le SEO spam parce qu’ils comprennent le contexte. Ce cas montre que c’est exactement l’inverse : un contenu bien structuré et sémantiquement cohérent trompe une IA bien mieux qu’il ne tromperait un humain.
SEO programmatique : l’outil n’est pas coupable, l’intention l’est
Soyons précis pour ne pas jeter le bébé avec l’eau du bain. Le SEO programmatique n’est pas intrinsèquement problématique. Une plateforme immobilière qui génère automatiquement une page par ville et par type de bien, c’est du SEO programmatique. Un site e-commerce qui crée ses fiches produits depuis un catalogue structuré, pareil. C’est efficace, scalable, et parfaitement légitime dès lors que le contenu est utile pour quelqu’un.
Ce qui change ici, c’est l’intention. Ces 215 000 pages n’ont pas été créées pour aider un utilisateur à choisir un logiciel. Elles ont été créées pour apparaître dans les réponses d’une IA. La nuance est énorme : le contenu n’est pas optimisé pour être lu, il est optimisé pour être indexé et cité. C’est du spam industriel déguisé en éditorial de comparaison.
Et il y a probablement une couche supplémentaire. Le rapport ne le précise pas explicitement, mais la logique business derrière ce type de site est généralement l’affiliation ou le placement sponsorisé. Les logiciels « recommandés » dans ces pages ont très bien pu payer pour y figurer. Tu te retrouves donc potentiellement avec Perplexity qui cite comme source neutre ce qui est en réalité une régie publicitaire déguisée en éditorial. Deux niveaux de manipulation pour le prix d’un.
⚠️ À retenir : quand Perplexity ou ChatGPT cite une source pour recommander un logiciel, rien ne garantit que cette source est éditoriale plutôt que commerciale. Vérifier l’URL citée prend 10 secondes et peut t’éviter de baser une décision à 500 €/mois sur du spam IA.
Ce que ça révèle sur les angles morts de l’AI Search
Google a mis vingt ans à construire ses signaux E-E-A-T (Experience, Expertise, Authoritativeness, Trustworthiness) pour évaluer la qualité d’une source. Ces signaux sont imparfaits, mais ils sont éprouvés. Les moteurs de réponse IA doivent maintenant construire l’équivalent — mais pour un paradigme différent, où la source n’est pas « le site que l’utilisateur clique » mais « le document que le système ingère ». C’est un problème inédit, et manifestement pas encore résolu.
Ce cas d’usage illustre aussi un paradoxe : plus les LLM deviennent bons pour générer du texte qui « sonne vrai », plus il est facile de créer du contenu conçu pour les tromper. On utilise les mêmes outils des deux côtés de la barrière. Le contenu de spam est généré par des LLM, et c’est un LLM qui va le citer comme fiable. On est en train d’assister à une course aux armements dont les règles du jeu ne sont pas encore établies.
Ce que ça change concrètement pour toi et pour ton site
Si tu utilises Perplexity, ChatGPT Search ou Bing Copilot pour comparer des outils ou des logiciels, applique désormais le même scepticisme que pour n’importe quelle autre source en ligne. Regarde l’URL citée. Est-ce un domaine reconnu dans l’industrie ? Y a-t-il un « À propos » crédible avec de vrais auteurs identifiables ? La date de création du domaine est-elle récente ? Ces questions prennent trente secondes et filtrent une bonne partie du problème.
Pour les entreprises qui investissent dans leur référencement et leur visibilité en ligne, ce phénomène a une implication directe : vos concurrents peuvent potentiellement « acheter » une présence dans les réponses IA via ce type de sites, sans que leur produit ne mérite cette visibilité. Ce qui était autrefois un avantage lié à la qualité éditoriale réelle devient une course où la quantité de contenu généré prime sur la substance. C’est frustrant, mais c’est la réalité du moment.
WESTCODE BY LEB
Studio web en Mayenne — On crée des outils numériques qui transforment
La bonne nouvelle, si on peut appeler ça comme ça : ce genre de manipulation finit toujours par être détecté et pénalisé. Le rapport Trellner a eu suffisamment de traction sur Hacker News — 400 points, près de 200 commentaires — pour que les équipes de Perplexity et des autres soient au courant. Les domaines identifiés vont probablement être blacklistés dans les semaines à venir. Mais d’autres les remplaceront, et le cycle recommencera.
✅ Conseil pratique : si tu veux que ton site soit cité positivement par des IA, la meilleure stratégie reste la même qu’en SEO classique — du contenu original, des auteurs identifiables, des preuves d’expertise réelle. C’est long, mais c’est le seul signal que les filtres anti-spam (humains ou IA) ne peuvent pas facilement répliquer.
Mon avis : on sous-estime le coût de cette manipulation
Ce qui me frappe dans cette histoire, ce n’est pas la sophistication de l’arnaque — c’est sa simplicité. Tu prends un LLM, un template, une liste de catégories de logiciels, et tu génères 215 000 pages en quelques jours. Coût marginal : presque zéro. Bénéfice potentiel : être cité comme source fiable dans des millions de réponses IA, avec un possible modèle d’affiliation derrière. Le ROI de la manipulation n’a jamais été aussi favorable. C’est un problème d’économie de l’attention autant que de technologie.
On a collectivement fantasmé sur l’idée que les moteurs IA allaient « tuer » le SEO spam parce qu’ils comprennent le contexte plutôt que les seuls mots-clés. Ce cas précis démontre que c’est exactement l’inverse : un contenu sémantiquement cohérent et bien structuré trompe une IA bien plus efficacement qu’il ne tromperait un lecteur humain averti. Le problème n’est pas résolu, il s’est juste déplacé.
Mon pari : dans dix-huit mois, les grands moteurs de réponse IA auront des listes noires de domaines, des systèmes de vérification d’autorité éditoriale, et des accords formels avec des éditeurs reconnus — un peu ce que Perplexity essaie déjà de mettre en place avec ses partenariats médias. Mais d’ici là, si tu cherches un logiciel à déployer pour ton équipe, ouvre un deuxième onglet et vérifie la source. Parce que l’IA, pour l’instant, ne le fait pas à ta place.



