Les archives techniques ouvertes font une promesse : une personne peut vérifier les éléments d’un projet et une machine récupérer des informations sans demander une permission pour chaque page. Cette promesse devient fragile lorsqu’un client traite une interface conçue pour les humains comme une API d’extraction sans plafond. Les mesures publiées par kernel.org ne disent pas qu’il faut fermer les données publiques ; elles rappellent que le choix de représentation détermine qui paie le coût de l’ouverture.
Kernel.org décrit un trafic soutenu qui demande de façon répétée des pages de commits rendues, plutôt que d’utiliser le transfert Git natif. Ces mesures n’identifient pas tous les clients et ne prouvent pas que chaque requête vient d’une société d’IA nommée. Elles révèlent néanmoins un problème familier aux navigateurs de code, documentations, bases publiques et outils de suivi : une collection finie peut exposer un nombre pratiquement illimité de vues HTML coûteuses.
Modéliser le coût des représentations, pas seulement des requêtes
Un compteur de requêtes est un mauvais modèle de capacité si deux URL déclenchent des travaux très différents. Un clone de dépôt transfère des objets organisés que le client peut parcourir localement. Une page de commit peut devoir résoudre l’historique, lancer un moteur de rendu, construire la navigation et générer du HTML neuf. Ce sont deux lectures publiques, mais elles ne consomment pas le même CPU, cache ni la même attention d’exploitation.
Dressez un inventaire des familles de routes : contenu statique, cache, requête de base, parcours de dépôt, recherche, diff ou rendu serveur. Associez-y latence médiane et de queue, temps CPU, taux de cache, URL distinctes par client et ratio entre réponses et travail utile. Vous pourrez ainsi détecter un client qui disperse son trafic dans des combinaisons inédites. Une URL publique n’est pas forcément une unité stable : une révision peut offrir plusieurs vues, et filtres, tris ou pagination peuvent produire d’innombrables variantes.
Proposer une voie de masse moins coûteuse
Un export caché dans le pied de page n’est pas une stratégie d’accès. Si l’archive possède un protocole natif, des instantanés, une API documentée, un flux RSS/Atom ou un dump signé, expliquez les usages et le rythme de mise à jour. Rendez ce chemin visible près de l’interface humaine et aux endroits adaptés à la découverte machine. Le comportement souhaité doit être plus simple que le scraping page par page.
Pour le code, cela peut être clone ou fetch ; pour un registre public, un export daté et un flux incrémental ; pour de la documentation, un lot versionné avec identifiants stables. Ces formats améliorent la reproductibilité, mais doivent eux aussi être bornés : taille de page, curseur, champs et sémantique des changements. Une API offrant recherche infinie, jointures arbitraires ou toutes les versions historiques ne fait que déplacer le coût sous une autre URL.
Préserver les pages humaines et budgéter le travail machine
Les pages lisibles restent nécessaires à l’inspection, aux liens, à l’accessibilité et à la recherche ordinaire. Mettez en cache les réponses stables, normalisez les variantes inoffensives, limitez la pagination et évitez les combinaisons de filtres sans fin. Les URL canoniques font converger lecteurs et robots vers le même document. Les limites doivent suivre le coût : une page statique légère ne supporte pas le même rythme qu’une recherche ou un diff à la demande. Limitez concurrence et durée de l’opération chère, gardez de la capacité pour visiteurs, miroirs et collaborateurs, et préférez un résultat en cache, Retry-After ou un lien bulk à une panne imprévisible.
Vérifier que la défense conserve l’accès
Les règles robots communiquent une préférence, mais la RFC 9309 n’en fait pas un contrôle d’autorisation. Combinez-les avec des consignes aux robots, des limites de débit et de l’observabilité. Les clients coopératifs doivent s’identifier, fournir un contact, respecter les limites et choisir le format le moins coûteux ; des contrôles techniques doivent aussi fonctionner lorsque l’identité est absente ou trompeuse.
Un challenge ou un blocage IP large peut réduire une courbe tout en excluant lecteurs, outils d’assistance, miroirs et automatisation légitime. Mesurez donc volume de routes coûteuses, renouvellement des chemins et saturation du rendu, mais aussi échecs de visites normales et latence des routes utiles. Des données de masse portables, des pages lisibles et des budgets fermes pour le calcul intensif permettent de garder une archive ouverte sans accepter la surcharge permanente.
Nous croisons sources primaires, documentation produit et cas d’usage réels pour vous aider à déterminer si un outil convient à votre manière de travailler.
