ouaisfieu · tuto
Référencement & découvrabilité

Vos pages méritent d'être trouvées.

Vous publiez des pages et personne ne les voit ? Pire, elles disparaissent de Google sans prévenir ? Ce guide explique pourquoi, en langage simple, et vous donne tout pour y remédier — y compris des modèles à copier-coller. Aucune connaissance préalable requise.

1 Publier la page est en ligne 2 Explorer le robot la visite 3 Indexer ajoutée au catalogue 4 Apparaître dans les résultats robots.txt noindex canonical ✗
Le parcours d'une page. Une seule étape qui casse — et la page n'apparaît jamais, ou disparaît. Tout ce guide sert à protéger ce chemin.
01Le modèle mental

Comment un moteur de recherche fonctionne, vraiment

Avant toute astuce, il faut une image mentale juste. Sans elle, le référencement ressemble à de la magie. Avec elle, presque tout devient logique — y compris les pannes.

Imaginez Google comme la plus grande bibliothèque du monde, avec un seul bibliothécaire increvable : un petit robot logiciel appelé crawler (ou « robot d'exploration » ; celui de Google s'appelle Googlebot). Son travail se découpe en trois temps, et c'est exactement le parcours du schéma en haut de page.

1. Explorer (crawl)

Le robot suit les liens de page en page, comme on parcourt les rayons. Il « lit » le code de chaque page qu'il visite. S'il ne trouve aucun chemin vers votre page — aucun lien, nulle part — il ne la découvre jamais. Une page sans lien entrant est une page orpheline : invisible, même parfaite.

2. Indexer

Quand le robot a lu une page, il décide de l'ajouter (ou non) à son immense catalogue : l'index. « Être indexé », c'est avoir sa fiche dans le catalogue. Tant qu'une page n'est pas indexée, elle ne peut apparaître dans aucun résultat, quoi que vous fassiez. C'est l'étape qui nous intéresse le plus, parce que c'est là que vos pages « disparaissent ».

3. Classer (ranking)

Quand quelqu'un fait une recherche, Google trie les fiches de son catalogue pour afficher les plus pertinentes en premier. C'est le classement. La plupart des gens pensent que « le SEO » se résume à cette étape (« être premier »). En réalité, les deux étapes précédentes — être exploré et être indexé — sont la condition de tout. On ne peut pas être bien classé si l'on n'est même pas dans le catalogue.

La distinction la plus importante du guide. Apparaître dans les résultats (indexation) et apparaître haut dans les résultats (classement) sont deux problèmes différents. Vos pages qui « disparaissent » sont un problème d'indexation — le premier à régler. Ce guide s'y attaque en priorité.

02Le bon vocabulaire

Référencement, SEO, découvrabilité : qui fait quoi

Trois mots qu'on mélange souvent. Les distinguer évite bien des malentendus.

  • Référencement — le mot français large : tout ce qui fait qu'un site est « référencé », c'est-à-dire connu et listé par les moteurs et annuaires.
  • SEO (Search Engine Optimization) — l'optimisation pour les moteurs de recherche. C'est le sous-ensemble « technique + contenu » qui vise à être indexé et bien classé sur Google, Bing, etc.
  • Découvrabilité — le concept le plus vaste : la capacité d'être trouvé partout. Pas seulement sur Google, mais aussi via les partages sur les réseaux (d'où les cartes Open Graph), les flux RSS, les assistants IA, le bouche-à-oreille, les liens d'autres sites.

Dans la pratique, ils se recouvrent largement, et ce guide les traite ensemble. Retenez juste l'esprit : le SEO vise les moteurs ; la découvrabilité vise les humains et les machines, partout où ils cherchent. On veut les deux.

03Diagnostic
La section qui vous concerne

Pourquoi mes pages disparaissent de Google ?

Une page qui était indexée et qui ne l'est plus : c'est presque toujours l'une des causes ci-dessous. Bonne nouvelle — elles sont presque toutes réparables en quelques minutes, et la page revient généralement sous quelques jours à quelques semaines. Dépliez chaque fiche pour le signe, la cause et la réparation.

i

Le symptôme typique : « visible sur Bing, mais disparu de Google ». C'est extrêmement courant, surtout sur les hébergements gratuits comme GitHub Pages. Bing est plus tolérant et garde les pages plus longtemps ; Google est plus strict et retire plus vite dès qu'un réglage cloche. Si Bing vous trouve encore, votre page n'est pas cassée — il y a juste une cause à corriger côté Google.

Les causes, de la plus bloquante à la plus subtile

Le signe
La page est en ligne, s'ouvre normalement, mais Google la « voit » et refuse de l'indexer.
La cause
Une ligne <meta name="robots" content="noindex"> dans le <head>, ou un en-tête HTTP X-Robots-Tag: noindex. Souvent laissée par un thème, un générateur de site, ou copiée d'une page de test.
Réparer
Supprimez la balise, ou remplacez-la par content="index, follow". C'est la première chose à vérifier, toujours.
Le signe
Plusieurs pages, voire tout le site, sortent des résultats d'un coup. Search Console signale « Bloquée par le fichier robots.txt ».
La cause
Une règle Disallow: trop large à la racine du domaine. Un simple Disallow: / interdit tout le site.
Réparer
Ouvrez votre-domaine/robots.txt dans le navigateur et lisez-le. Il doit autoriser l'exploration (voir la section 05). Attention : ce fichier n'est valable qu'à la racine du domaine.
Le signe
La page disparaît « toute seule », sans erreur visible. Search Console dit : « Page en double, Google a choisi une autre page canonique ».
La cause
La balise <link rel="canonical"> dit à Google « la vraie version de cette page est à telle adresse ». Si cette adresse est fausse, vide, un copier-coller d'une autre page, ou pointe vers un domaine d'exemple, Google indexe l'autre adresse et abandonne la vôtre. C'est l'une des causes de désindexation les plus fréquentes et les plus sournoises.
Réparer
Chaque page doit avoir une canonical qui pointe vers sa propre URL exacte et réelle. Une seule adresse par page. Jamais de placeholder oublié (du type VOTRE-DOMAINE). Voir la section 04.
Le signe
Le trafic s'effondre après une migration, un passage en HTTPS, l'ajout d'un domaine personnalisé, ou un changement www / sans-www.
La cause
Pour Google, http:// et https://, ou www et sans-www, sont des sites différents. S'il indexait l'ancienne version et que la canonical (ou les redirections) ne pointent pas vers la nouvelle, l'ancienne fiche meurt sans que la nouvelle prenne le relais.
Réparer
Choisissez une version officielle, redirigez tout le reste vers elle (redirection 301), et faites pointer toutes les canonical vers cette version. Déclarez la nouvelle adresse dans Search Console.
Le signe
Google indexe une partie des pages seulement, et laisse tomber les plus vides. Bing, lui, les garde encore.
La cause
Des pages avec très peu de texte, du contenu identique d'une page à l'autre, ou des restes de gabarit (« Lorem ipsum », « page en construction »). Google « déclasse » ou retire temporairement ce qu'il juge sans valeur.
Réparer
Donnez à chaque page un contenu réel, unique et utile. Mieux vaut peu de pages solides que beaucoup de pages creuses. Supprimez ou fusionnez les coquilles vides.
Le signe
Une page précise n'est jamais découverte, alors que le reste du site va bien.
La cause
Le robot navigue par les liens. Si aucune autre page (menu, accueil, sommaire) ne pointe vers celle-ci, et qu'elle n'est pas dans le sitemap, il n'a aucun chemin pour la trouver.
Réparer
Ajoutez au moins un lien vers chaque page depuis une page déjà indexée, et listez-la dans le sitemap.xml (section 05).
Le signe
Search Console connaît la page (« Détectée — actuellement non indexée ») mais ne l'a jamais explorée. Date de dernière exploration vide.
La cause
Google a découvert l'URL (souvent via le sitemap) mais a reporté l'exploration. Sur un domaine partagé comme github.io, qui héberge des millions de sites, Google répartit son effort et peut laisser des pages en attente longtemps. Ce n'est pas une erreur de votre part.
Réparer
Vérifiez le site dans Search Console, utilisez « Inspecter l'URL » puis « Demander une indexation » pour chaque page importante. Un domaine personnalisé est souvent indexé bien plus vite qu'une adresse github.io (voir section 10).
Le signe
La page est vide quand on regarde le code source (clic droit → « Afficher le code source »), et le texte n'apparaît qu'une fois la page chargée dans le navigateur.
La cause
Si tout le contenu est injecté par du JavaScript, certains robots (et surtout les plus petits) ne le voient pas. Google rend le JavaScript, mais avec retard et de façon imparfaite.
Réparer
Mettez le contenu essentiel (titres, texte, liens) directement dans le HTML livré, comme cette page. Le JavaScript doit enrichir, pas porter le contenu de base.

Poser un diagnostic en 4 minutes (Google Search Console)

L'outil officiel et gratuit qui répond à « pourquoi ma page n'est pas indexée » s'appelle la Google Search Console. C'est le tableau de bord de la santé de votre site vu par Google. La marche à suivre :

  1. Allez sur Google Search Console et ajoutez votre site (la procédure complète est en section 11).
  2. En haut, collez l'URL exacte de la page dans « Inspecter une URL ».
  3. Lisez le verdict : « L'URL est sur Google » (tout va bien) ou un motif précis de non-indexation — c'est lui qui pointe vers la bonne fiche ci-dessus.
  4. Si le motif est corrigé, cliquez sur « Demander une indexation » pour remettre la page dans la file.
!

Ordre de réparation recommandé. 1) Cherchez une balise noindex. 2) Lisez votre robots.txt. 3) Vérifiez la canonical de la page. 4) Vérifiez le site dans Search Console et inspectez l'URL. 5) Soumettez le sitemap et demandez l'indexation. Dans la grande majorité des cas, la visibilité revient en quelques jours à quelques semaines une fois la cause levée.

04Sur la page

Les balises essentielles (à copier)

Cinq éléments dans l'en-tête de chaque page font 80 % du travail « sur la page ». Voici un <head> modèle, propre et commenté. Adaptez-le, ne le laissez jamais avec des valeurs d'exemple.

head — modèle de base
<!-- 1. La langue de la page : aide Google et les lecteurs d'écran -->
<html lang="fr">
<head>
  <meta charset="utf-8">
  <meta name="viewport" content="width=device-width, initial-scale=1">

  <!-- 2. Le TITRE : ~50-60 caractères, UNIQUE pour chaque page.
       C'est le lien bleu cliquable dans les résultats. -->
  <title>Titre clair de la page · Nom du site</title>

  <!-- 3. La DESCRIPTION : ~150 caractères, donne envie de cliquer.
       N'aide pas au classement, mais au taux de clic. -->
  <meta name="description" content="Une phrase qui résume la page et donne envie de la lire.">

  <!-- 4. La CANONICAL : l'adresse officielle de CETTE page.
       ⚠️ Sa PROPRE URL réelle. Jamais un exemple oublié. -->
  <link rel="canonical" href="https://votre-domaine/page.html">

  <!-- 5. Autoriser l'indexation (le défaut, mais explicite = sûr) -->
  <meta name="robots" content="index, follow">
</head>

Ce que chaque élément fait, en clair

  • La langue (lang="fr") — indique à Google et aux outils d'accessibilité dans quelle langue vous écrivez. Une ligne, souvent oubliée.
  • Le titre (<title>) — l'élément le plus important de la page pour les moteurs. C'est le lien cliquable dans les résultats. Faites-le unique pour chaque page, descriptif, et placez l'idée principale au début.
  • La description — n'influence pas directement le classement, mais c'est elle qui s'affiche sous le titre. Une bonne description = plus de clics. Écrivez pour un humain, pas pour un robot.
  • La canonical — la balise la plus puissante et la plus dangereuse. Bien réglée, elle évite les doublons. Mal réglée, elle désindexe (revoir la section 03). Règle d'or : chaque page pointe vers sa propre adresse réelle.
  • L'autorisation d'indexer — par défaut, une page est indexable. La déclarer explicitement vous évite la mauvaise surprise d'un noindex caché.

Trois réflexes en plus dans le corps de la page

Au-delà du <head>, le contenu lui-même envoie des signaux. Trois habitudes simples :

  • Une hiérarchie de titres claire — un seul <h1> par page (le grand titre), puis des <h2> pour les sections, des <h3> pour les sous-parties. C'est le plan du document : les moteurs s'en servent pour comprendre la structure.
  • Un texte alternatif sur les images (alt="...") — décrit l'image pour les moteurs et les personnes malvoyantes. Bonus : référence vos images dans la recherche d'images.
  • Des adresses lisibles — préférez /guide-referencement à /page?id=42x. Une URL qui se lit se retient, se partage et se comprend.
05La plomberie

Être explorable : robots.txt, sitemap, liens

Les balises disent quoi indexer ; ces trois éléments aident le robot à trouver vos pages et à savoir où aller. C'est la différence entre une page exploitée et une page jamais découverte.

Le fichier robots.txt

Un simple fichier texte, posé à la racine du domaine, qui dit aux robots ce qu'ils ont le droit d'explorer. Pour un site normal, on veut tout autoriser et indiquer où se trouve le plan du site :

robots.txt — à la racine du domaine
# Autoriser tous les robots à tout explorer
User-agent: *
Allow: /

# Indiquer l'adresse du plan du site
Sitemap: https://votre-domaine/sitemap.xml

L'erreur qui tue. Une seule ligne Disallow: / interdit l'exploration de tout le site, et vos pages quittent les résultats. Si vos pages se désindexent, ouvrez d'abord votre-domaine/robots.txt dans le navigateur et lisez-le ligne par ligne.

Le plan du site : sitemap.xml

La liste de toutes vos pages, dans un format que les moteurs lisent. Il ne garantit pas l'indexation, mais il aide à la découverte — surtout pour les pages peu liées. Vous le soumettrez ensuite dans Search Console (section 11).

sitemap.xml — la liste de vos pages
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://votre-domaine/</loc>
    <lastmod>2026-06-26</lastmod>
  </url>
  <url>
    <loc>https://votre-domaine/page.html</loc>
    <lastmod>2026-06-26</lastmod>
  </url>
</urlset>

Ajoutez une entrée <url> par page, avec son adresse réelle dans <loc> et la date de dernière modification dans <lastmod>.

Les liens internes (et la chasse aux pages orphelines)

Le robot voyage par les liens. Chaque page importante doit être atteignable en suivant des liens depuis l'accueil. Une page vers laquelle rien ne pointe — et qui n'est pas dans le sitemap — est invisible, peu importe sa qualité. Reliez vos pages entre elles : menus, sommaires, « articles liés ». C'est gratuit, et c'est l'un des leviers les plus négligés.

À retenir. robots.txt dit « tu peux entrer », le sitemap.xml dit « voici la carte », et les liens internes tracent les chemins. Les trois ensemble garantissent qu'aucune page utile ne reste cachée.

06Hors moteurs

Le partage social : Open Graph & carte

La découvrabilité, ce n'est pas que Google. Quand on partage votre lien sur une messagerie ou un réseau, un joli aperçu (titre, description, image) donne dix fois plus envie de cliquer qu'un lien nu. Ces balises s'appellent Open Graph.

head — aperçu de partage
<!-- Open Graph : l'aperçu sur réseaux et messageries -->
<meta property="og:type" content="article">
<meta property="og:title" content="Le titre qui s'affichera dans l'aperçu">
<meta property="og:description" content="La phrase d'accroche sous le titre.">
<meta property="og:url" content="https://votre-domaine/page.html">
<meta property="og:image" content="https://votre-domaine/apercu.png">
<meta property="og:image:width" content="1200">
<meta property="og:image:height" content="630">

<!-- Carte Twitter / X (réutilise souvent l'image Open Graph) -->
<meta name="twitter:card" content="summary_large_image">
<meta name="twitter:title" content="Le titre de l'aperçu">
<meta name="twitter:description" content="La phrase d'accroche.">
<meta name="twitter:image" content="https://votre-domaine/apercu.png">
  • L'image (og:image) est la pièce maîtresse. Sans elle, les aperçus s'affichent vides et beaucoup de gens (et d'outils) ignorent le lien. Format idéal : 1200 × 630 pixels.
  • L'URL doit être réelle, comme la canonical. Les outils d'aperçu s'en servent pour retrouver la page.
  • Pour tester votre aperçu avant publication : des sites gratuits comme opengraph.xyz affichent le rendu sur toutes les plateformes d'un coup.
i

Astuce. Pensez aussi au flux RSS (feed.xml) : c'est l'« abonnement » auquel se branchent les lecteurs de news, certains agrégateurs et outils de veille. Un modèle est fourni avec ce guide. Déclarez-le dans le <head> avec <link rel="alternate" type="application/rss+xml">.

07Parler aux machines

Les données structurées (schema.org)

Une page web, pour un robot, c'est du texte. Les données structurées sont une étiquette invisible qui dit explicitement : « ceci est un article », « ceci est une recette », « voici l'auteur et la date ». Les moteurs comprennent mieux, et peuvent afficher des résultats enrichis (étoiles, FAQ dépliable, dates).

Le format recommandé est le JSON-LD : un petit bloc qu'on glisse dans le <head>, séparé du contenu visible. Voici l'exemple le plus utile — décrire un article :

head — données structurées (article)
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "Article",
  "headline": "Le titre de votre article",
  "description": "Un résumé en une phrase.",
  "datePublished": "2026-06-26",
  "author": { "@type": "Person", "name": "Votre nom" },
  "inLanguage": "fr-FR"
}
</script>
  • Ce n'est pas obligatoire pour être indexé — mais c'est un bonus net de découvrabilité, et certains outils de veille s'appuient dessus pour repérer les entités d'une page (personnes, organisations, lieux).
  • Restez honnête. Décrivez ce que la page contient réellement. Annoncer une note 5 étoiles qui n'existe pas sur la page peut entraîner une pénalité.
  • Vérifiez votre code avec l'outil gratuit Test des résultats enrichis de Google (search.google.com/test/rich-results) : il valide le JSON-LD et liste ce que Google y a compris.
  • Autres types utiles : FAQPage (questions/réponses), HowTo (tutoriels par étapes), BreadcrumbList (fil d'Ariane), Recipe, Event. Cette page elle-même utilise TechArticle + FAQPage — regardez son code source !
08Les fondations

HTTPS, mobile, vitesse : le socle technique

Trois exigences que Google considère comme acquises. Les négliger ne « pénalise » pas spectaculairement, mais plombe discrètement la confiance et le classement.

HTTPS (le cadenas)

Votre site doit être servi en https://, pas http://. C'est un signal de confiance minimal, et les navigateurs marquent les sites non sécurisés comme « non sûrs ». Bonne nouvelle : GitHub Pages fournit le HTTPS gratuitement. Veillez juste à activer l'option « Enforce HTTPS » et à ce que vos liens internes et canonical utilisent bien https://.

L'adaptation mobile (mobile-first)

Google indexe d'abord la version mobile de votre site (« mobile-first indexing »). Si votre page est illisible sur téléphone, elle est pénalisée pour tout le monde. La balise <meta name="viewport"> (présente dans le modèle de la section 04) est le minimum vital. Testez en réduisant la fenêtre de votre navigateur, ou avec l'outil de test d'optimisation mobile.

La vitesse (Core Web Vitals)

Google mesure l'expérience réelle avec trois indicateurs, les Core Web Vitals. En clair :

  • LCP — le temps avant que le contenu principal s'affiche. Vise moins de 2,5 s. Une grosse image non optimisée est l'ennemi n°1.
  • INP — la réactivité : le délai entre un clic et la réaction de la page. Vise moins de 200 ms.
  • CLS — la stabilité visuelle : éviter que le contenu « saute » pendant le chargement. Vise moins de 0,1.

Pour mesurer tout cela d'un clic et obtenir des recommandations concrètes : PageSpeed Insights (pagespeed.web.dev) et l'outil Lighthouse intégré au navigateur Chrome.

i

Accessibilité = référencement. Un site bien structuré pour les personnes handicapées (titres logiques, textes alternatifs, bon contraste, navigation au clavier) est aussi mieux compris par les moteurs. Les deux objectifs avancent ensemble — ce ne sont pas des chantiers séparés.

09L'essentiel

Le contenu : la vraie clé

On peut tout régler à la perfection sur le plan technique et rester invisible si le contenu n'a pas de valeur. Aucune balise n'indexe une page vide. À l'inverse, un excellent contenu se fait remarquer presque malgré la technique.

Écrire pour les humains, d'abord

Le grand principe moderne du référencement tient en une phrase : écrivez pour les personnes, pas pour l'algorithme. Google a passé vingt ans à apprendre à reconnaître le contenu réellement utile. Les vieilles ruses (répéter un mot-clé cinquante fois, « bourrage de mots-clés ») sont aujourd'hui contre-productives.

Ce que Google appelle « E-E-A-T »

Un cadre que Google utilise pour juger la qualité. En français simple, quatre questions que votre page doit pouvoir satisfaire :

  • Expérience — l'auteur parle-t-il de quelque chose qu'il a réellement vécu ou testé ?
  • Expertise — l'auteur s'y connaît-il dans le domaine ?
  • Autorité — la source est-elle reconnue, citée, fiable ?
  • Confiance — la page est-elle honnête, à jour, sans intentions trompeuses ?

Quelques habitudes qui paient

  • Des titres honnêtes. Le titre doit refléter le contenu. Un titre racoleur qui déçoit fait fuir, et le signal remonte aux moteurs.
  • Répondre à une vraie question. Les gens cherchent des réponses. Une page qui résout précisément un problème sera trouvée et reliée par d'autres.
  • Garder à jour. Un contenu actualisé est mieux traité qu'une page figée depuis des années. Mettez à jour, et reflétez-le dans <lastmod>.
  • Mériter des liens. Quand d'autres sites pointent vers vous, c'est le plus fort signal de confiance qui existe. On ne les achète pas : on les obtient en étant utile.

La hiérarchie des priorités. 1) Un contenu utile et unique. 2) Qu'il soit explorable et indexable (sections 04-05). 3) Qu'il soit clair pour les machines (sections 06-07). 4) Que le socle technique tienne (section 08). Dans cet ordre. La technique sert le contenu, jamais l'inverse.

10Votre hébergeur
GitHub Pages

Les pièges propres à GitHub Pages

GitHub Pages est gratuit, solide et fournit le HTTPS — mais il a quelques particularités qui expliquent une grande partie des désindexations. Si vos pages disparaissent, lisez ceci en priorité.

Piège n°1 — le robots.txt n'est lu qu'à la racine du domaine

Les robots ne lisent robots.txt qu'à une seule adresse : la racine du domaine, soit ouaisfieu.github.io/robots.txt. Un fichier robots.txt placé dans un sous-dossier comme ouaisfieu.github.io/tuto/robots.txt est tout simplement ignoré. Conséquence selon votre organisation de dépôts :

  • Si /tuto/ est un dossier de votre dépôt principal ouaisfieu.github.io : placez robots.txt et sitemap.xml à la racine de ce dépôt (donc servis à ouaisfieu.github.io/robots.txt).
  • Si /tuto/ est un dépôt séparé (le dépôt tuto) : le robots.txt qui compte est dans votre dépôt ouaisfieu.github.io, pas dans le dépôt tuto. Mettez-y une règle qui autorise tout et pointe vers votre sitemap.

Cause de désindexation classique. Un vieux robots.txt restrictif à la racine de ouaisfieu.github.io peut bloquer tout ce qui est en dessous, y compris /tuto/, sans que vous le sachiez. Ouvrez https://ouaisfieu.github.io/robots.txt dans votre navigateur, maintenant, et vérifiez ce qu'il contient.

Piège n°2 — la canonical et les adresses d'exemple

C'est l'erreur la plus probable derrière des pages « qui disparaissent toutes seules ». Si une page contient une balise canonical (ou des balises og:url) laissée sur une adresse d'exemple — du genre VOTRE-DOMAINE ou un autre domaine —, Google indexe cette autre adresse et abandonne la vôtre. Chaque page de /tuto/ doit avoir une canonical qui pointe vers sa propre URL réelle en https://ouaisfieu.github.io/tuto/....

Piège n°3 — « Détectée mais non indexée » sur github.io

Le domaine github.io héberge des millions de sites. Google y répartit son effort d'exploration et laisse souvent des pages en attente longtemps — le fameux statut « Détectée — actuellement non indexée ». Ce n'est pas une faute de votre part, mais il faut l'aider activement. Deux leviers très efficaces :

  • Demander l'indexation à la main dans Search Console, page par page (procédure en section 11). Sur GitHub Pages, c'est souvent ce qui débloque réellement l'indexation.
  • Envisager un domaine personnalisé. Un retour très répandu de la communauté : un site passé sur un nom de domaine à soi est souvent indexé bien plus vite et plus durablement qu'une adresse github.io. Si le référencement compte pour vous, c'est l'investissement le plus rentable (et GitHub Pages gère le HTTPS du domaine personnalisé automatiquement).

Deux fichiers GitHub Pages utiles

  • Une page 404.html à la racine — GitHub Pages l'affiche automatiquement pour toute adresse introuvable. Une vraie page d'erreur, claire et avec un lien de retour, vaut mieux qu'une page blanche (et évite les « fausses 404 » mal vues des moteurs). Un modèle est fourni avec ce guide.
  • Un fichier .nojekyll (vide) à la racine — si vous n'utilisez pas Jekyll, il garantit que tous vos fichiers sont servis tels quels, y compris ceux dont le nom commence par un tiret bas. Une simple précaution.

Mémo GitHub Pages. HTTPS activé (« Enforce HTTPS ») · robots.txt à la racine du domaine, pas dans le sous-dossier · canonical réelle sur chaque page · site vérifié dans Search Console + indexation demandée · domaine personnalisé si possible. Ces cinq points règlent l'immense majorité des disparitions.

11La marche à suivre

Faire indexer une page, pas à pas

La procédure complète pour qu'une page passe de « invisible » à « dans les résultats ». À faire une fois pour le site, puis à chaque nouvelle page importante.

  1. Vérifier que la page est en ligne et en HTTPS

    Ouvrez son adresse exacte dans le navigateur. Elle doit s'afficher en https://, sans erreur. Regardez le code source (clic droit → « Afficher le code source ») : le titre et le texte doivent y être présents.

  2. Ajouter le site à Google Search Console

    Sur search.google.com/search-console, ajoutez une propriété de type « Préfixe d'URL » avec votre adresse. Google vous demande de prouver que le site est à vous : la méthode la plus simple sur GitHub Pages est de déposer le petit fichier de vérification HTML qu'il fournit (ou d'ajouter la balise meta de vérification dans le <head>).

  3. Soumettre le sitemap

    Dans Search Console, menu « Sitemaps », indiquez l'adresse de votre sitemap.xml. Google s'en servira pour découvrir toutes vos pages. C'est aussi là que vous verrez s'il est bien lu.

  4. Inspecter l'URL et demander l'indexation

    Collez l'adresse d'une page dans « Inspecter une URL » (en haut). Lisez le verdict, puis cliquez sur « Demander une indexation ». Répétez pour chaque page importante. C'est l'étape qui débloque le plus souvent les sites GitHub Pages.

  5. Faire de même sur Bing (bonus rapide)

    Bing a son équivalent, Bing Webmaster Tools, qui sait importer directement votre configuration depuis Google Search Console. Bing est plus rapide à indexer les petits sites — un gain facile pour votre découvrabilité.

  6. Optionnel : IndexNow, pour une indexation instantanée (hors Google)

    IndexNow permet de notifier Bing, Yandex, Naver et Seznam en quelques secondes à chaque publication. Google ne participe pas à IndexNow — pour lui, ce sont les étapes 2 à 4 qui comptent. Pour activer IndexNow : déposez un fichier-clé à la racine du domaine, puis appelez l'URL de notification :

    IndexNow — notifier Bing & Yandex (pas Google)
    # 1. Générer une clé (chaîne hexadécimale), ex. :
    #    openssl rand -hex 16
    # 2. La déposer à la racine : votre-domaine/VOTRE_CLE.txt
    #    (le fichier contient uniquement la clé)
    # 3. À chaque publication, appeler :
    curl "https://api.indexnow.org/indexnow?url=https://ouaisfieu.github.io/tuto/&key=VOTRE_CLE&keyLocation=https://ouaisfieu.github.io/VOTRE_CLE.txt"
    !

    Le fichier-clé doit rester accessible. S'il disparaît (erreur 404), vos notifications échouent silencieusement. Et rappelez-vous : IndexNow signale qu'une page existe — il ne force pas son indexation si le contenu est bloqué ou trop mince.

  7. Patienter, puis vérifier

    L'indexation prend de quelques jours à quelques semaines. Revenez dans Search Console (rapport « Pages ») pour suivre ce qui est indexé et ce qui ne l'est pas, avec le motif. Tant que la cause est levée, la page finit par réapparaître.

12Boîte à outils

Les outils utiles & les mythes à oublier

Tout est gratuit, et quelques sites suffisent. Voici la trousse essentielle, puis le ménage à faire dans les idées reçues qui font perdre du temps.

Les outils qui comptent vraiment

Outil (gratuit)À quoi ça sert
Google Search ConsoleL'outil central. Vérifier votre site, voir ce qui est indexé ou non (et pourquoi), soumettre le sitemap, demander l'indexation d'une page.
Bing Webmaster ToolsL'équivalent pour Bing. Sait importer votre configuration depuis Search Console. Bing indexe vite les petits sites.
Test des résultats enrichisValider vos données structurées (schema.org) et voir ce que Google y comprend. search.google.com/test/rich-results
PageSpeed Insights / LighthouseMesurer la vitesse (Core Web Vitals) et obtenir des conseils concrets. pagespeed.web.dev
opengraph.xyzPrévisualiser l'aperçu de partage (Open Graph) sur toutes les plateformes avant de publier.
IndexNowNotifier Bing, Yandex, Naver, Seznam en quelques secondes. Pas Google — pour lui, sitemap + Search Console.

Six mythes à laisser tomber

La réalité
Google l'ignore depuis plus de dix ans. Elle est inoffensive mais inutile. Concentrez l'énergie sur le titre, la description, le contenu et la structure.
La réalité
Inutile, et parfois nuisible : ces annuaires de masse sont souvent de mauvaise qualité et peuvent vous associer à du spam. Une bonne présence dans Google et Bing suffit largement.
La réalité
Google ne participe pas à IndexNow (en 2026). Le protocole accélère Bing, Yandex et consorts — utile, mais sans effet sur Google, qui garde son propre fonctionnement.
La réalité
Le « bourrage de mots-clés » est contre-productif depuis longtemps : Google le détecte et le pénalise. Écrivez naturellement, pour des humains.
La réalité
L'indexation est entièrement gratuite. Les annonces Google Ads, payantes, sont un sujet totalement distinct : elles n'influencent pas l'indexation ni le classement naturel.
La réalité
C'est un entretien continu : le web bouge, les concurrents publient, les pages vieillissent. Revenez régulièrement vérifier Search Console et rafraîchir votre contenu.
Mémo

La checklist à chaque publication

Avant de mettre une page en ligne, parcourez cette liste. Vous pouvez l'imprimer (la page est conçue pour : Ctrl/Cmd + P).

  • Titre unique et descriptif~50-60 caractères, l'idée principale au début, différent des autres pages.
  • Description engageante~150 caractères, écrite pour donner envie de cliquer.
  • Canonical = l'adresse réelle de la pageSa propre URL exacte. Jamais un exemple oublié type VOTRE-DOMAINE.
  • Aucune balise noindex involontaireVérifier le <head> et le robots.txt à la racine.
  • Aperçu de partage (Open Graph)Titre, description et image 1200 × 630 renseignés.
  • Page reliée et listéeAu moins un lien depuis une autre page + ajoutée au sitemap.xml.
  • HTTPS et lisible sur mobileS'ouvre en https:// et s'affiche correctement sur téléphone.
  • Contenu réel, unique et utilePas de coquille vide, pas de « page en construction ».
  • Indexation demandéeAprès publication : « Inspecter l'URL » → « Demander une indexation » dans Search Console.
À copier

Les fichiers fournis avec ce guide

La théorie de ce guide, prête à l'emploi. Adaptez les adresses d'exemple à votre site, déposez les fichiers au bon endroit (le LISEZ-MOI explique tout), et publiez.

modele-page.html

Un gabarit HTML complet et commenté. Copiez-le pour démarrer chaque nouvelle page avec toutes les bonnes balises.

robots.txt

À déposer à la racine du domaine. Autorise l'exploration et pointe vers votre sitemap.

sitemap.xml

La liste de vos pages, à compléter avec vos adresses. À soumettre dans Search Console.

feed.xml

Un flux RSS prêt à remplir, pour les lecteurs de news et les outils de veille.

404.html

Une page d'erreur soignée que GitHub Pages affichera automatiquement pour les adresses introuvables.

[clé].txt

Le fichier-clé IndexNow (pour Bing & Yandex), à déposer à la racine du domaine.

LISEZ-MOI.txt

Le mode d'emploi : déploiement sur GitHub Pages et ordre de réparation d'une désindexation.

tuto-card.png

L'image d'aperçu (Open Graph) de ce guide, au format 1200 × 630.

Le réflexe le plus important. Un fichier sur votre ordinateur n'est visible de personne. Tout commence à l'hébergement à une vraie adresse, puis à la vérification dans Search Console. Faites cela, et la moitié des problèmes de découvrabilité disparaissent d'eux-mêmes.

Trouvez-moi

Vous savez maintenant pourquoi une page se désindexe, et comment la faire revenir. Si vous ne deviez retenir qu'une chose : hébergez à une vraie adresse, donnez à chaque page sa propre canonical réelle, et vérifiez votre site dans Search Console. Le reste découle de là.

Guide pratique de référencement & de découvrabilité, écrit pour les débutants. Vous pouvez le copier, l'adapter et le réutiliser. Les outils cités (Google Search Console, Bing Webmaster Tools, PageSpeed Insights, IndexNow) sont gratuits.

Dernière mise à jour : 2026 · Le référencement évolue — revérifiez les détails sensibles (comportement des moteurs, outils) au fil du temps.
Page volontairement sobre, accessible, imprimable et lisible sans JavaScript. Son propre code source est un exemple : faites « Afficher le code source ».