Vous publiez trois articles par semaine depuis six mois, et vos positions reculent. Le réflexe est de chercher la pénalité, le lien toxique, l’algorithme qui vous en veut. Dans la grande majorité des cas, le coupable est plus banal : le site grossit plus vite que son contenu ne le justifie, et chaque nouvelle page creuse tire l’ensemble vers le bas. Comprendre ce mécanisme change la façon dont on gère un site tech qui produit beaucoup.
Ce que l’indexation page par page change vraiment
Google n’attribue pas d’autorité à un site dans son ensemble, comme on le croit souvent. L’indexation se fait à l’échelle de chaque URL, une par une, et une page explorée puis laissée de côté n’apporte rien au domaine. Elle existe techniquement, elle consomme du budget de crawl, mais elle ne transmet aucune pertinence thématique.
Si vous voulez creuser les bases de ce fonctionnement, le site getupstartup.fr détaille les rouages du référencement pour les équipes qui débutent. Le rapport de couverture de la Search Console devient alors un document de travail, pas un tableau de bord qu’on consulte une fois par trimestre.
La mention « explorées, actuellement non indexées » revient sur des pages dont le contenu pose problème : trop court, trop proche d’une autre, ou sans valeur ajoutée réelle. Ce n’est pas un hasard si le robot est venu et reparti sans garder.
Il a jugé que la page n’apportait rien de neuf à son index, et il a continué sa route. Multipliez ce scénario par cinquante pages générées à la chaîne, et vous obtenez un domaine qui pèse de moins en moins lourd sur ses requêtes historiques, jusqu’à perdre la pertinence thématique qu’il avait mis des années à construire.
Selon SEMrush, cité par Les Makers, près d’un site sur trois présente des problèmes de contenu dupliqué, capable de faire chuter le trafic naturel de 50 % chez les plus touchés. Le chiffre fait peur. Il décrit surtout une habitude : produire des variantes d’une même page pour couvrir tous les mots-clés imaginables, sans jamais se demander si chacune mérite sa place dans l’index.
Le piège des pages ajoutées sans contenu réel
Une équipe tech qui développe une fonctionnalité a tendance à créer une page par écran, par paramètre, par version d’API. C’est logique du point de vue du produit, beaucoup moins du point de vue du référencement. Ces pages sont souvent générées automatiquement, avec un titre, deux lignes de description et rien d’autre. Elles ressemblent à du contenu, elles ont une URL propre, mais elles ne répondent à aucune question qu’un utilisateur se poserait vraiment.
Le problème n’est pas qu’elles soient mauvaises prises isolément. C’est leur accumulation qui pèse. Chaque page vide consomme du crawl, dilue les signaux internes envoyés vers les pages qui comptent, et brouille la lecture thématique du site. Un domaine avec trente pages solides et trois cents pages creuses envoie un message confus au moteur. De quoi parle ce site, au fond ? La réponse devient difficile à formuler, même pour l’équipe qui l’a construit.
La duplication aggrave le phénomène. Quand deux pages répondent à la même intention avec un texte à peine différent, le moteur doit choisir, et ce choix n’est pas toujours celui qu’on espérait. Des outils comme Screaming Frog ou Copyscape repèrent ce genre de recouvrement sans qu’on ait à ouvrir chaque URL une par une. Franchement, une heure passée sur un audit de duplication vaut mieux qu’un mois de publication frénétique.
Les erreurs qui reviennent à chaque audit
Ce qu’on voit systématiquement dans les profils de site dégradés
Les mêmes schémas reviennent d’un projet à l’autre, avec des variations de détail. Un audit sérieux les fait ressortir en quelques minutes, à condition de savoir où regarder. Les voici, dans l’ordre où ils apparaissent généralement.
- Des pages produit ou service générées depuis une base de données, avec un texte identique d’une fiche à l’autre et seuls le titre et la photo qui changent.
- Pourquoi les balises de titre sont-elles dupliquées sur la moitié du site, alors que la correction prend une après-midi ?
- Un maillage interne qui pointe toujours vers les mêmes pages, laissant les nouvelles URLs orphelines, sans aucun lien entrant depuis le corps du texte.
- Des articles publiés pour tenir un rythme, sans recherche d’intention préalable, qui répondent à une requête déjà couverte trois fois ailleurs sur le site.
- Une confusion tenace entre le travail sur la page elle-même et le travail hors de la page, deux chantiers qui ne se pilotent pas avec les mêmes indicateurs.
La différence entre le SEO on-page et le SEO off-page se résume simplement : le premier concerne tout ce que vous contrôlez sur votre site, titres, structure, contenu, vitesse, maillage ; le second porte sur les signaux externes, liens entrants et mentions. Beaucoup d’équipes investissent dans le second en espérant compenser un premier négligé, et le calcul ne fonctionne jamais très longtemps. Sur ce point, voir aussi notre article sur trafic visibilite site internet.
Reste la question du budget, parce qu’elle bloque pas mal de projets. Faire du SEO sans dépenser un euro est possible : la Search Console, les outils d’analyse de logs, les extensions de navigateur et un peu de méthode suffisent pour un audit sérieux. Ce qui coûte, ce n’est pas l’outil, c’est le temps de correction. Et ce temps, une petite structure le trouve plus facilement qu’un budget logiciel.
Il y a aussi la question de la mesure, qui fausse parfois le diagnostic. Travailler depuis un moteur de recherche sans traçage change la perception qu’on a de ses propres positions. Les résultats affichés ne correspondent pas toujours à ceux que verra un visiteur lambda. Ce n’est pas un détail quand on ajuste une stratégie sur des données partiellement personnalisées, et cette illusion de position explique bien des décisions prises à contretemps.
Une méthode de nettoyage à contre-courant
WebRankInfo propose une approche des « Pages Actives sur 1 an » : on liste toutes les URLs qui n’ont généré aucune visite, ou presque, sur douze mois glissants. Le tri se fait sur les données réelles, pas sur une intuition. Une page qui n’a rien ramené en un an n’a probablement jamais trouvé son public, et son maintien coûte plus qu’il ne rapporte.
À partir de cette liste, trois décisions possibles. On enrichit la page si le sujet mérite d’exister, on la fusionne avec une voisine plus forte, ou on la supprime avec une redirection propre vers la page la plus proche. Ce qui compte, c’est de trancher. Laisser une page vide en ligne en espérant qu’elle décolle un jour, c’est laisser une fuite ouverte dans le budget de crawl.
Contrairement à ce qu’on lit partout, il ne faut pas désindexer les pages légales. WebRankInfo conseille de laisser les pages contact, mentions légales, politique de confidentialité, CGU et conditions de livraison se faire crawler et même indexer. Ces pages jouent un rôle dans l’analyse du sérieux et de la réputation du site, ce qu’on appelle l’analyse E.A.T. Les supprimer de l’index revient à retirer des éléments qui rassurent autant le visiteur que le moteur.

Le rythme de nettoyage compte autant que la méthode. Une fois par an, on reprend la liste, on compare avec l’année précédente, et on regarde si les pages conservées ont réellement progressé. Cette revue annuelle évite l’accumulation silencieuse, celle qui se produit quand personne ne regarde pendant dix-huit mois et qu’on découvre soudain quatre cents URLs inutiles. Un site tech évolue vite, ses anciennes pages encore plus vite.
Il faut aussi accepter que tout ne se répare pas en une passe. Certaines pages retrouvent des positions après enrichissement, d’autres restent muettes malgré les efforts, et la bonne décision devient alors la suppression. Ce tri demande du jugement, pas un script, et c’est précisément là que la plupart des équipes décrochent, faute de savoir trancher entre enrichir et supprimer.

Le sujet devient plus délicat quand la direction mesure la réussite au nombre de pages publiées. Ce critère pousse à produire toujours plus, jamais à retirer. Renverser cette logique demande de présenter les chiffres autrement : trafic par page, taux d’indexation, positions moyennes sur les requêtes qui comptent. Une équipe qui voit ces courbes comprises comprend aussi pourquoi supprimer cinquante pages creuses peut faire remonter le reste, et cette démonstration chiffrée vaut mieux qu’un long discours sur la qualité.
Arrêter de compter les pages, regarder ce qu’elles rapportent
Une chute de positions n’est presque jamais une sanction tombée du ciel. C’est le résultat mécanique d’un site qui a grossi sans que son contenu suive, page après page, jusqu’à ce que l’ensemble perde sa cohérence aux yeux du moteur.
La bonne nouvelle, c’est que ce phénomène se corrige : audit de duplication, tri des pages mortes, enrichissement ou suppression, et une revue annuelle pour ne pas retomber dans le même piège. Le travail est ingrat, personne ne le remarque quand il est bien fait, mais il pèse plus lourd que trois mois de publication à la chaîne. Combien de pages de votre site n’ont réellement servi à personne cette année ?