CodexBot
Cette page est dédiée aux discussions concernant le robot CodexBot : bugs, suggestions, questions. Pour signaler une anomalie, merci de mentionner l'article concerné. Le bot répond parfois.
CodexBot interrompt ses éditions dès que {{stop}} ou STOP apparaît dans un message de cette page ; le retrait du mot le relance. Dans le doute, faites-le.
Page principale · Journal : état des opérations et évolutions récentes · foire aux questions
Auteur[x] + prénom[x] + nom[x]
modifier
Salut,
Je m'interroge sur ce genre de modification où on retrouve à la fois les champs auteur[x] et prénom[x] + nom[x]. Cela ne fait-il par doublon ? Ne faut-il pas garder soit auteur[x], soit prénom[x] + nom[x] ? - Evynrhud (discuter) 14 août 2026 à 17:59 (CEST)
- Salut @Evynrhud

- Oui. Je découvre aussi que le rendu de {Lien web} corrige tout seul, en n'affichant qu'une seule fois l'auteur (pas de doublon affiché).
- Jordan Pardon, « Le PSG atomise l’Inter Milan… », sur Foot Mercato, (consulté le )
- A corriger. Merci du signalement. Irønie 14 août 2026 à 18:06 (CEST)
- C'était un conflit entre l'auteur découvert sur le site et les données écrite par le contributeur. Code corrigé. Edits erronés corrigés — Irønie 14 août 2026 à 18:48 (CEST)
- Ok. Impeccable. Merci pour ta réactivité. - Evynrhud (discuter) 14 août 2026 à 18:58 (CEST)
- C'était un conflit entre l'auteur découvert sur le site et les données écrite par le contributeur. Code corrigé. Edits erronés corrigés — Irønie 14 août 2026 à 18:48 (CEST)
Différence entre Article et Lien web
modifier
Bonjour,
Je ne comprends pas pourquoi le bot classe les références à lefigaro.fr, lesoir.be (et sans doute d'autres journaux en ligne) comme des "Articles" (de périodique). Voir par exemple ici sur Interparfums
Ce sont deux choses bien différentes : par exemple, lefigaro.fr devrait être classé comme "Site web". C'est un média (en ligne) qui comporte beaucoup plus de choses que Le Figaro (version papier), qui lui est un périodique.
Et vous n'avez aucune certitude que le texte en ligne (auquel on fait référence) se trouve à l'identique dans la version du périodique (et d'ailleurs la plupart du temps, ce n'est pas le cas).
Il y a là une confusion qu'il faudrait corriger rapidement avant de continuer l'utilisation intensive du bot, selon moi. Pourriez-vous m'éclairer sur ce sujet ? Merci ! Chrisalmon (discuter) 14 août 2026 à 21:52 (CEST)
- Bonjour Chrisalmon,
- Merci pour ce signalement documenté, diff à l'appui.
- Sur le fond, la distinction {{Article}} / {{Lien web}} pour les sites de presse en ligne n'a jamais été tranchée sur fr.wiki. La question a été posée dès 2018 (Discussion modèle:Article#Distinction avec Lien web), reprise au Bistro du 29 mars 2020, puis sur Discussion modèle:Lien web#Paramètres site et périodique — sans consensus à chaque fois. Les positions vont de « {{Article}} pour tout média d'information, {{Lien web}} pour le reste » (le modèle {{Article}} dispose d'ailleurs d'un paramètre
lire en ligne) à « {{Article}} seulement s'il y a numéro, volume et pages, donc en pratique une parution papier ou une revue ». Ta remarque sur l'absence de certitude que le texte en ligne figure à l'identique dans le papier avait déjà été formulée en 2018, et n'a jamais reçu de réponse. C'est donc une zone grise ancienne où chacun fait plutôt comme il l'entend, pas une erreur que j'aurais introduite.
Côté mécanique : je ne prétends pas savoir s'il y a eu parution papier, je n'en ai aucun moyen. J'applique une configuration par domaine, publique et modifiable : Utilisateur:CodexBot/config liens externes. Pour lefigaro.fr, le réglage étaitauto, c'est-à-dire « suivre les métadonnées de la page ». Or ces métadonnées (balisage schema.org « NewsArticle ») relèvent du référencement et sont posées automatiquement par les CMS de presse sur à peu près tout leur contenu web, brèves boursières comprises — ton second exemple vient d'ailleurs debourse.lefigaro.fr. Le signal est plus faible qu'il n'en a l'air, je te l'accorde.
L'enjeu reste toutefois modeste : les deux modèles produisent un rendu proche, et passer de l'un à l'autre ne perd aucune information (le nom du média migre simplement depériodique=verssite=).
Cela dit, ta remarque m'a fait vérifier les usages, et pour ce domaine les contributeurs semblent plutôt pencher vers {{Lien web}}. Irønie a validé le basculement de lefigaro.fr et lesoir.be enlien webdans ma configuration. Si tu repères d'autres domaines mal classés, n'hésite pas.- Cordialement, CodexBot (discuter) 14 août 2026 à 22:59 (CEST)
En ligne le pour lien web
modifier
Bonjour, je vois dans plusieurs liens web qui remontent en erreur dans Catégorie:Page du modèle Lien web comportant une erreur, l'erreur E : paramètre date et en ligne le présents simultanément, avec des valeurs différentes à la suite de l'intervention du bot, exemple https://fr.wikipedia.org/w/index.php?title=Championnat_de_France_masculin_de_handball_2011-2012&diff=238645547&oldid=238618673, n'est-il pas possible d'intégrer un paramètre pour remplacer le en ligne le qu'il y avait dans le lien par date sans rajouter le champs date ? Remy34 (discuter) 15 août 2026 à 14:02 (CEST)
- Bonjour @Remy34.
- Bug confirmé et corrigé . Le paramètre
en ligne len'était pas reconnu comme alias dedatepar le bot, qui laissait donc les deux paramètres cohabiter au lieu de fusionner proprement. - C'est un cas rare, sans incidence sur le rendu visuel du modèle : pas grave, mais corrigé pour la prochaine passe du bot. Merci pour le signalement. — Irønie 15 août 2026 à 14:57 (CEST)
Petit bug [Gallica/POP]
modifier
Bonjour,
Petit but constaté dans cette correction avec l'ajout inapproprié de |site=Pariser Zeitung totalement inexplicable ^ LeFnake (discuter) 16 août 2026 à 16:44 (CEST)
- Salut LeFnake
- Oui bug sur "site" ("périodique"). Provoqué par l'ambiguïté de certaines données Wikidata pour des sites avec des sous-domaines web (Gallica, culture.gouv.fr…).
Le bot est corrigé depuis 30 minutes. ZiziBot va nettoyer les erreurs .- Merci ! A+ Irønie 16 août 2026 à 17:42 (CEST)
Changement des dates de consultation des url
modifierBonjour Irønie. Une remarque sur le fonctionnement actuel de votre bot. Lors d'une intervention de CodexBot sur la page Cité d'urgence, celui-ci a amélioré deux modèles "Lien web" présents sur la page, en changeant notamment la date de consultation des liens. Or, je ne trouve pas cela pertinent. En effet, il pourrait y avoir une modification de la page entre la date de consultation initiale, qui a servi à sourcer le passage, et la date du passage du bot. Cela reste théorique, mais cela pourrait mener à un contresens il me semble. Je ne sais pas si votre bot fait cette modification à chaque fois, mais est-elle vraiment pertinente et nécessaire ? D'avance merci pour votre réponse, et bien cordialement, choumix (discuter) 20 août 2026 à 08:30 (CEST).
- Bonjour @ChoumX.
- Le paramètre
consulté leest défini ainsi : « Date de consultation du document. Permet de surveiller l’obsolescence de l'URL. ». Et de retrouver la page archivée quand l'URL est périmée. Traduction du paramètre "access date" sur enwiki, complété également par des bots là-bas. - Oui, CodexBot modifie toujours "consulté le", après avoir testé le site (et vérifié que son contenu n'est pas devenu une page parking ("casino", "site à vendre"…). Ça permet de surveiller et traiter en masse les liens morts (recherche d'archive).
- Le concept de validation rédactionnelle de la source, n'a pas de paramètre (idée "relu le").
- Surtout ce risque d'évolution du texte de la source est un problème rare et secondaire, par rapport à la fréquence de pourrissement des liens (5% par an). Irønie 20 août 2026 à 10:12 (CEST)
- Bonjour CodexBot

- J'approuve complètement la remarque de choumix.
- Merci d'arrêter de falsifier les dates de consultation dans les refs : merci de conserver celles qui y sont déjà et d'exploiter l'historique pour reconstituer celles qui manquent, comme je viens de le faire sur la page Une amie dévouée. C'est plus de travail bien sûr, mais quel sens y a-t-il à coller systématiquement la date d'aujourd'hui. Cela revient à nier le sens et l'utilité du paramètre "consulté le".
- C'est littéralement de la falsification.
- Merci d'avance,
- Wikipédiennement. - EmDee (discuter) 20 août 2026 à 10:13 (CEST)
- Votre vision de l'usage de "consulté le" est personnelle. Proposez la création d'un paramètre "relu le" (ou autre) pour la validation et le contrôle humain des sources. — Irønie 20 août 2026 à 10:28 (CEST)
- Re-Bonjour Irønie

- Ma vision de l'usage du paramètre "consulté le" n'est pas personnelle. Le Modèle:Lien web définit ce paramètre comme "Date de consultation du document", et pas comme date de run d'un bot des années après la consultation par le rédacteur de la page.
- En tant que créateur de la page Une Amie dévouée, je constate que le bot y a falsifié les mentions "consulté le=2024-10-21", "consulté le=11 septembre 2024" et "consulté le=30 août 2024" en les remplaçant de façon systématique par "consulté le=20 août 2026". Comment pouvez-vous justifier cela ? Comment ?
- Ensuite, et toujours en tant que créateur de cette page, un simple coup d'œil à son historique me permet de constater que les références Dunand, Mallen, Guerrin, Kerkour, Figaro Magazine, version Femina, Hochberg et Ouest-France étaient déjà présentes le 6 avril 2024, ce qui exclut absolument "consulté le=20 août 2026" pour ces refs.
- Je vous prie donc d'arrêter ces modifs unilatérales et non concertées, qui reposent sur une interprétation incorrecte du paramètre "consulté le".
- Merci d'avance,
- Wikicourtoisement. - EmDee (discuter) 20 août 2026 à 10:52 (CEST)
- @EmDee Par le passé, j'ai fait des mini-sondages et des annonces sur les fonctionnalités de CodexBot. Des centaines/milliers de contributeurs ont accepté tacitement ce comportement du bot sur "consulté le".
- Quelques questions ou remarques épisodiques sur "consulté le" (voir archives de cette page), pareilles à la votre. Y'a ~20 millions de liens externes à vérifier pour détecter ~1.9 millions de liens morts et retrouver des archives. C'est ça la tâche importante et l'usage prioritaire de "consulté le".
Encore cette semaine, sur le WP:Le bistro la présentation des modifs de CodexBot : Wikipédia:Le Bistro/14 août 2026#CodexBot sur liens externes et .- Votre désaccord ne suffit pas pour que j'arrête le bot.
- J'ai ajouté {{bots|deny=CodexBot}} sur votre article. Le bot ne s'en occupera plus jamais.
- — Irønie 20 août 2026 à 12:03 (CEST)
- Re-Bonjour Irønie
- Votre vision de l'usage de "consulté le" est personnelle. Proposez la création d'un paramètre "relu le" (ou autre) pour la validation et le contrôle humain des sources. — Irønie 20 août 2026 à 10:28 (CEST)
Re-Bonjour Irønie ![]()
Sur la page d'archive que vous mentionnez plus haut, je vois surtout des réactions peu favorables comme celles de Couleys et Okhjon.
Ce que je ne comprends pas c'est votre formulation « interprétation personnelle du "consulté le" comme validation rédactionnelle ».
Quand on insère le 10 juin 2026 une ref qui cite une page du Parisien datée du 3 juin, alors on met "date=3 juin 2026" et "consulté le=10 juin 2026". Donc, comme le dit la doc, c'est la "Date de consultation du document" par le rédacteur. Il semble que les contributeurs cités plus haut comprennent la même chose que moi.
Je ne comprends donc pas votre concept de "validation rédactionnelle" ! Il n'y a pas de "validation rédactionnelle" : il y a un rédacteur qui cite le 10 juin une source du 3 juin. Ce n'est pas une validation, juste une consultation.
Par contre, ce que je comprends, c'est que vous avez programmé votre bot pour qu'il fasse une "validation technique" de l'existence ou obsolescence de la source.
Si le bot constate que le lien est toujours vivant, il ne devrait pas écraser le "consulté le=" d'origine mais le conserver : dans mon exemple ci-dessus, "date=3 juin 2026" et "consulté le=10 juin 2026" restent valables même si votre bot est passé par là aujourd'hui pour vérifier que le lien est toujours vivant.
En fait, ce qu'il vous manque, c'est un paramètre supplémentaire "vérifié le=" dont vous devriez demander la création aux gestionnaires des Modèles Lien Web et Lien Ouvrage : de cette façon, si le bot constate que le lien est toujours vivant, il peut conserver le "consulté le=" d'origine et ajouter "vérifié le=" en date d'aujourd'hui.
Et si le bot constate que le lien est mort, il peut aller le chercher sur la Wayback Machine d'Archive.org ou autre et ajouter "|archive-url=https://web.archive.org/web/xxxxxxxxxxxxxxx |archive-date=", mais je suppose que c'est ce que vous faites.
Wikipédiennement. - EmDee (discuter) 20 août 2026 à 14:23 (CEST)
- Ce serait une idée. EmDee
- Mais c'est alors "vérifié le" qui sera affiché dans les articles (car c'est ça l'info cruciale pour lecteur et maintenance : savoir d'un coup d'œil si le lien a été récemment "vérifié" — ou si c'est encore un lien pourri).
- Et on demandera ensuite que "consulté le" soit masqué (info triviale ou secondaire, utile pour personne, sans gain pour l'expérience du lecteur) — et personne ne verra plus (ni ne remplira) "consulté le".
- Aussi, si le lien est ajouté à l'article un 12 février 2020, la "date de consultation" originale est forcément à la même date. On peut déduire cette date de l'historique de l'article (script Wikiblame pour aider). Donc l'information est triviale, inutile. A qui sert-elle ?
- Je réfléchirai et proposerai éventuellement débat/sondage. Irønie 20 août 2026 à 14:47 (CEST)
- Mais, dites-moi, quand le lien est mort, vous allez bien en rechercher une archive quelque part comme sur la Wayback Machine d'Archive.org ? Parce que c'est cela l'essentiel. EmDee (discuter) 20 août 2026 à 14:50 (CEST)
- Ce que dit la documentation :
- {{Lien web}} : « La date d’accès à l’URL du paramètre lire en ligne. Permet de surveiller l’obsolescence du lien. Correspond à accessdate sur la Wikipédia anglophone. »
- {{Article}} : « Date à laquelle a été consulté pour la dernière fois l'article à l'adresse URL fournie. Permet de surveiller l’obsolescence du lien.» Par défaut5 septembre 2026
- {{Lien brisé}} : « La dernière date à laquelle le document a été constaté bien en ligne. »
- {{Lien archive}} : « Paramètre non pris en compte. […] aucune valeur ajoutée. »
- Les trois premières décrivent la même chose : un horodatage de dernier accès constaté, destiné à la maintenance des liens. « Dernière fois », « surveiller l'obsolescence » : ce sont des valeurs qui se mettent à jour. Nulle part la doc ne décrit une date d'insertion figée.
- La quatrième est plus radicale : {Lien archive} ignore purement et simplement "consulté le", "brisé le" et "archivé le" au motif qu'ils n'apportent rien.
- En pratique je vois circuler trois lectures incompatibles :
- date d'ajout de la source — non documentée. Probablement née du fait que l'ÉditeurVisuel pré-remplit le champ avec date du jour.
- date de relecture humaine (« j'atteste que la source dit bien ça ») — non documentée non plus, et non vérifiable.
- date de dernier accès constaté — la seule qui soit documentée. C'est celle qu'utilise mon bot.
- Je verrai pour une harmonisation/clarifications des documentation de modèle. Ou éventuel paramètre supplémentaire.
- Pour l'utilité et pertinence de l'affichage de cette date, se rappeler que seulement 0,3% des lecteurs Wikipédia cliquent sur une ref[1]. En dehors du besoin des bots, c'est juste de la décoration.
- — Irønie 20 août 2026 à 17:04 (CEST)
- Bonjour et merci à tou.te.s pour ce débat. L'approche statistique (par certains aspects) que vous apportez, Irønie, est intéressante, mais j'en comprends que certaines informations sont surtout là... pour les bots. Or, dans un souci de validité des sources, il faut bien que l'on sache quelle version d'une source "mobile" dans le temps a été utilisée. Si pour un article de périodique, cela a peu de chance d'arriver, pour une page web, elle vit, des informations sont ajoutées, modifiées, soustraites, surtout pour des pages non datées. Donc merci par avance pour le travail d'harmonisation que vous évoquez. Car si "statistiquement" cela ne va pas concerner grand monde, cela garantit un peu plus, il me semble, la fiabilité de la Wikipédia en général. Merci encore ! Bien cordialement, choumix (discuter) 20 août 2026 à 17:24 (CEST).
- Mais, dites-moi, quand le lien est mort, vous allez bien en rechercher une archive quelque part comme sur la Wayback Machine d'Archive.org ? Parce que c'est cela l'essentiel. EmDee (discuter) 20 août 2026 à 14:50 (CEST)
Irønie :
Voici la définition du champ "consulté le=" (accessdate) du modèle Lien Web donnée par les autres Wikipédia majeures d'Europe occidentale : aucune ne parle de contrôle d'obsolescence.
anglais : Date complète à laquelle l'URL d'origine a été consultée
allemand : Date complète à laquelle le site web a été trouvé
néerlandais : Date à laquelle vous avez consulté cette page comme source pour Wikipédia
danois : Date complète à laquelle la source a été consultée
italien : Date du dernier accès
espagnol : Date à laquelle le site web a été consulté
catalan : Date complète de la consultation
Ces définitions vont dans le même sens que moi : "à laquelle l'URL d'origine a été consultée", "à laquelle le site web a été trouvé", "à laquelle la source a été consultée", "à laquelle le site web a été consulté", surtout celle en néerlandais "Date à laquelle vous avez consulté cette page comme source pour Wikipédia". Seule celle en italien pourrait être considérée comme allant (peut-être) dans le sens d'un contrôle d'obsolescence : "Date du dernier accès".
Ceci dit, le contrôle d'obsolescence est très important et vous avez raison de vous y atteler , je dis juste que la doc du modèle Lien Web n'en parle jamais, sauf singulièrement en français.
Mais vous ne m'avez pas répondu : que fait le bot quand le lien est mort ?
Cordialement. - EmDee (discuter) 20 août 2026 à 17:30 (CEST)
- Bonjour EmDee, sur votre question "quid quand lien mort", voir par exemple ce diff sur Force de réaction de l'OTAN : le bot trouve une base type Wikiwix ou Wayback Machine et remplace le lien mort par une archive. C'est bien ça, Irønie ? choumix (discuter) 20 août 2026 à 18:03 (CEST)
- C'est un peu un débat de sourds parce que le terme « consulté » peut honnêtement être entendu au sens technique ou éditorial. L'intention de départ n'a peut-être pas été assez clairement documentée, ce qui expliquerait cet amalgame.
- Idéalement, une formulation du type « (lien actif au jj/mm/aaaa, contenu vérifié le jj/mm/aaaa) » serait peut-être souhaitable mais ça alourdit carrément les modèles et ça représenterait un chantier énorme.
- S'il fallait faire un choix, Irønie a développé un argument-massue: les liens morts sont considérablement plus fréquents que les liens actifs qui changent sur le fond. — Pharma💬 20 août 2026 à 23:16 (CEST)
- Tout à fait d'accord pour clore ici le débat et reconnaître l'énorme intérêt du travail d'Irønie, même si je reste persuadé qu'il y a un problème de documentation du modèle Lien Web.
- Merci donc pour le travail en cours.
- NB pour
Irønie : d'après sa doc, le modèle Bots ne doit pas être utilisé dans l'espace encyclopédique ; j'ai donc retiré la mention {{bots|deny=CodexBot}} de la page Une Amie dévouée où vous l'aviez insérée. - Belle journée.- EmDee (discuter) 21 août 2026 à 09:31 (CEST)
- Bonjour. Je ne sais que dire. Je suppose que, dans ce cas, le mieux est l'ennemi du bien. Bonne continuation, choumix (discuter) 21 août 2026 à 09:45 (CEST)
- Merci pour vos retours.
- Je vais réfléchir à la solution d'un nouveau paramètre de date ; paramètre complémentaire et non affiché, écrit par le bot. Genre "lien testée le", "url testée le", "lien actif le", "accès vérifié le", "bot testé le"… Pour le bot, ça reviendrait au même.
- choumix : Oui, je crois aussi qu'il s'agit d'un choix entre perfection et pragmatisme.
- Irønie 21 août 2026 à 10:30 (CEST)
- Bonjour. Je ne sais que dire. Je suppose que, dans ce cas, le mieux est l'ennemi du bien. Bonne continuation, choumix (discuter) 21 août 2026 à 09:45 (CEST)
┌─────────────────────────────────────────────────┘
Bonjour Irønie ![]()
Tout d'abord, merci une nouvelle fois pour tout le boulot réalisé.
Je pense que « la solution d'un nouveau paramètre de date non affiché du type "accès vérifié le" » est une très bonne alternative. Le cas échéant, pour répondre à « le risque d'évolution du texte de la source est un problème rare et secondaire (, par rapport à la fréquence de pourrissement des liens (5% par an).) », une alternative pourrait consister à mettre à jour le "consulté le" uniquement si le paramètre "date" est renseigné dans le modèle, ce qui couvrira en principe tous les articles de presse (au sens large) qui effectivement ne bougent généralement pas (ou très peu). En revanche, pour les pages non datées (peut-être que le bot peut le vérifier d'ailleurs) et donc susceptible d'évoluer sans qu'on ne le sache, il peut être pertinent de conserver la date à laquelle l'information est (présumée) vraie, sachant que le cas échéant, la page archivée à prendre en compte est celle à cette date-là et pas la date où le bot a vérifié que la page existe toujours. À titre d'exemple, contribuant principalement sur le projet handball, certains joueurs peuvent avoir une page listant leurs stats en équipe nationale et le "consulté le" indique donc la date à laquelle les stats sont (a priori) justes. Bon, il n'y a pas mort d'homme si le "consulté le" est changé sans que les stats soient mises à jour, mais c'est un peu dommage quoi et inversement, garder une vieille date de consultation pour un joueur actif permet de comprendre que les stats ne sont peut-être pas à jour. Autre exemple, l'entreprise X affiche sur son site avoir l'entreprise Y comme client : l'information peut être vraie au moment où le lien est inséré mais fausse quand le bot a vérifié que la page existe toujours.
Wikipédiennement, --LeFnake (discuter) 26 août 2026 à 17:24 (CEST)
- Bonsoir, la proposition de LeFnake, si réalisable, permettrait effectivement de répondre à la problématique ! Bien cordialement, choumix (discuter) 26 août 2026 à 19:10 (CEST)
- Désolé LeFnake, ChoumX, EmDee, Pharma, j'ai pas eu le temps de m'occuper du pépin "consulté le" et cette idée de nouveau paramètre ("accès vérifié le"?).
- Côté {{Lien web}}, je suis occupé par une autre évolution (et mini-sondage). Aussi la question du rendu des liens morts sans aucune archive.
- J'essayerai de pousser prochainement une discussion "consulté le" sur bistro ou PDD modèle. Le bot commence à accélérer sa cadence, faudrait régler ça vite. Je vous notifierai. A+ Irønie 3 septembre 2026 à 22:01 (CEST)
- Salut,
- pas de souci, à l'impossible personne n'est tenu ! C'est toujours plus facile et rapide pour nous d'avoir de vagues idées que pour toi de les implémenter concrètement. LeFnake (discuter) 4 septembre 2026 à 10:39 (CEST)
- @LeFnake Non, l'implémentation pour le bot c'est simple et rapide. Mon IA fera les modifications de code en 30 minutes, je vérifierai 10 minutes et paf c'est déployé. Ce sont les discussions nécessaires sur Wikipédia (clarifier le rôle des paramètres, l'utilité, nouveau paramètre du modèle, le consensus) qui prendront des heures !
A+ — Irønie 4 septembre 2026 à 11:25 (CEST)
- @LeFnake Non, l'implémentation pour le bot c'est simple et rapide. Mon IA fera les modifications de code en 30 minutes, je vérifierai 10 minutes et paf c'est déployé. Ce sont les discussions nécessaires sur Wikipédia (clarifier le rôle des paramètres, l'utilité, nouveau paramètre du modèle, le consensus) qui prendront des heures !
Anomalie
modifier
Y'a une anomalie ! Dans les articles Camille Camet, Franck Avitabile et Palais impérial de Perrache, un lien vers La Comédie politique a été ajouté sans raison dans les références pointant vers les Archives municipales de Lyon. *joSpe* →me contacter 23 août 2026 à 10:48 (CEST)
- Bonjour Jospe, et merci du signalement.
- C'est bien un bug. Le domaine archives-lyon.fr était associé au journal La Comédie politique via Wikidata : le « site officiel » (P856) de ce journal disparu y pointe, puisque ce sont les Archives municipales de Lyon qui en hébergent les numéros numérisés. Le bot en a déduit à tort que tout lien vers ce domaine provenait de ce journal.
- Le filtre est corrigé (les domaines d'archives et de bibliothèques sont désormais écartés de cette table), et je repasse sur les articles concernés (8) pour corriger .
- Désolé pour le désagrément. Irønie 23 août 2026 à 11:41 (CEST)
- Merci beaucoup. Bonne après-midi. *joSpe* →me contacter 23 août 2026 à 12:10 (CEST)
Lien pas brisé
modifier
Bonjour : votre bot vient indiquer un lien brisé dans cet article Coralie David, or, quand je clique sur le lien (que j'ai rétabli comme standard), j'arrive sur la page en question. C'est quoi la définition d'un lien brisé pour votre bot ? Parce que là, je ne vois pas bien… Mystery Man From Outerspace (discuter) 25 août 2026 à 11:22 (CEST)
- Bonjour Mystery Man From Outerspace,
- Ma définition d'un lien brisé : 404, 410, DNS mort — ou un HTTP 200 qui sert en réalité une page de parking ou d'erreur déguisée. Pour ce dernier cas, je cherche des formules du type « page introuvable », « n'existe plus »… et c'est exactement là que je me suis vautré.
- Or l'article du GROG contient cette phrase :
- « sans lui, elle n'existe pas, et chacun la rend unique »
- Ça parle de l'histoire que crée le rôliste. Moi, j'ai lu « n'existe pas », j'ai coché la case, et j'ai enterré une page en parfaite santé. J'ai pris une réflexion sur la nature du jeu de rôle pour un message d'erreur — c'est le genre d'introspection qu'on n'attend pas d'un robot, et vous avez bien fait de m'arrêter.
- La correction a été faite. Ces formules ne causeront plus de bug. Votre cas est passé en test de non-régression, donc cet article me servira désormais d'avertissement permanent.
- Merci pour le signalement, et désolé pour le dérangement. CodexBot (discuter) 25 août 2026 à 12:33 (CEST)
- Ratissage par ZiziBot pour corriger ce type d'erreurs. exemple — Irønie 25 août 2026 à 13:47 (CEST)
- Merci beaucoup pour ce signalement @Mystery Man From Outerspace. J'épluche des centaines de diff chaque semaine, mais j'avais manqué ce bug (présent depuis le 19 août) qui a touché 200 liens.
- Heureusement, je peux corriger facilement les anciens edits des bots. A+ Irønie 25 août 2026 à 14:24 (CEST)
- Ratissage par ZiziBot pour corriger ce type d'erreurs. exemple — Irønie 25 août 2026 à 13:47 (CEST)
titre mal récupéré
modifierBonjour,
sur cette diff qui a mis en forme cette page, le titre a été mal trouvé par le bot qui a mis "LMS" (pré-titre signifiant LiquiMolyStarligue, nom pompeux du championnat de France masculin de handball) au lieu du vrai titre "Dragan Gajic tire sa révérence" (pouvant être précédé ou pas de "LMS", perso je ne le trouve pas spécialement pertinent mais à voir aussi selon ce que le bot peut voir). Mais c'est peut-être mal balisé sur la page web ? Rien de bien méchant en tout cas.
De même, pour cette diff et cette diff, le lien vers un article sur Gallica a pris pour titre le nom du périodique (Hand-ball : bulletin fédéral), mais dans ce cas, je ne suis pas sûr qu'un bot puisse facilement trouver le vrai titre... Bon, pour le coup, c'est moi qui ai mal bossé car j'ai inséré ces sources comme un goujat, ce que je ne fais que trop rarement donc le cas ne devrait pas être rencontré souvent.
Plus largement, pour tout ce qui est sur Gallica, je pense qu'il serait plus pertinent d'utiliser le modèle Article comme évoqué dans la discussion ci-dessus. Par contre, si le titre de l'article/encart/section/paragraphe n'est pas identifiable (ce qui est souvent le cas), peut-être serait-il possible d'indiquer, suivant l'exemple des modèles {{Lien à corriger}} et {{Lien brisé}}, "titre à compléter" dans le titre de la référence et indiquer dans le résumé de modification (ou sur une section du principal projet ? Ca aurait sa place dans le "à faire" de la page de discussion, mais personne ne va le voir...) qu'il y a une référence à corriger ? Par exemple, au lieu de « Hand-ball : bulletin fédéral », sur Gallica, (consulté le ), cela pourrait donner « [Titre à compléter] », Hand-ball : bulletin fédéral, (lire en ligne, consulté le ). (NB : il y aurait d'autres infos à récupérer, mais c'est trop mal renseigné dans les métadonnées pour que ce puisse être fait automatiquement hélas). LeFnake (discuter) 27 août 2026 à 16:38 (CEST)
- Bonjour LeFnake, merci pour ces trois diffs.
- Pour handnews.fr, le bug est de mon côté. La page annonce « LMS | Dragan Gajic tire sa révérence - HandNews ». Je découpe ce genre de titre pour jeter le nom du site, mais je ne découpais que sur un seul type de séparateur : j'ai coupé sur le « | », et le second morceau a été jeté en bloc parce qu'il contenait « HandNews ». Il ne restait que le préfixe. Corrigé, avec test de non-régression : je découpe désormais sur tous les séparateurs, ce qui donne « LMS - Dragan Gajic tire sa révérence ». Effectif à ma prochaine mise à jour.
- Pour Gallica, pas de bug : la page n'expose que le titre du périodique dans ses métadonnées, jamais celui de l'article. Aucun robot ne peut le deviner.
- Sur votre proposition ({{Article}} + périodique + un titre à compléter), je ne me prononce pas : techniquement c'est à ma portée, Gallica est déjà un domaine que je traite à part, mais poser un titre de remplacement dans l'espace principal n'est pas une décision qui m'appartient. Je transmets à mon dresseur. CodexBot (discuter) 27 août 2026 à 20:04 (CEST)
Remplacement de liens web avec archives par Internet Archive par défaut
modifierBonjour, dans cette modif, CodexBot remplace des {{Lien web}} existants mais pointant vers une page morte et disposant d'une archive wikiwix fonctionnelle par des liens vers Internet archive. Un {{Lien mort}} est aussi disposant d'un lien vers une archive wikiwix fonctionnelle est aussi remplacé par un lien vers internet archive. Cela n'arrive que dans certains cas, pour une raison que je n'arrive pas à distinguer.
Voici les liens concernés :
- {{Lien web}}
- http://swikr.com/hp-chromebook-11-enfin-disponible-pour-la-france/ (adresse introuvable) remplacé par https://web.archive.org/web/20150227054227/http://swikr.com/hp-chromebook-11-enfin-disponible-pour-la-france/ alors que https://archive.wikiwix.com/cache/?url=http%3A%2F%2Fswikr.com%2Fhp-chromebook-11-enfin-disponible-pour-la-france%2F fonctionne
- https://www.coreboot.org/users.html (erreur 404) remplacé par https://web.archive.org/web/20220615042351/https://www.coreboot.org/users.html alors que https://archive.wikiwix.com/cache/?url=https%3A%2F%2Fwww.coreboot.org%2Fusers.html fonctionne
- https://chromiumnetbooks.com/samsung-series-5-chromebook/ (mort) remplacé par https://web.archive.org/web/20170227150057/http://chromiumnetbooks.com/samsung-series-5-chromebook/ alors que https://archive.wikiwix.com/cache/?url=http%3A%2F%2Fchromiumnetbooks.com%2Fsamsung-series-5-chromebook%2F fonctionne
- http://notebooksnews.com:80/processors/intel-celeron-847-benchmark (mort) remplacé par https://web.archive.org/web/20121113091156/http://notebooksnews.com:80/processors/intel-celeron-847-benchmark/ alors que https://archive.wikiwix.com/cache/?url=http%3A%2F%2Fnotebooksnews.com%2Fprocessors%2Fintel-celeron-847-benchmark%2F fonctionne
- http://www.toshiba.fr:80/laptops/chromebook/chromebook/toshiba-cb30-102/ (page disparue) remplacé par https://web.archive.org/web/20160806231625/http://www.toshiba.fr:80/laptops/chromebook/chromebook/toshiba-cb30-102/ alors que https://archive.wikiwix.com/cache/?url=http%3A%2F%2Fwww.toshiba.fr%2Flaptops%2Fchromebook%2Fchromebook%2Ftoshiba-cb30-102%2F fonctionne
- {{Lien brisé}} avec date dans « brisé le » :
- https://www.samsung.com/ca/consumer/office/chrome-devices/chromebooks/XE503C12-K04CA affichant https://web.archive.org/web/20260000000000*/https://www.samsung.com/ca/consumer/office/chrome-devices/chromebooks/XE503C12-K04CA (page générique) et https://archive.wikiwix.com/cache/?url=https://www.samsung.com/ca/consumer/office/chrome-devices/chromebooks/XE503C12-K04CA (archive fonctionnelle) remplacé par un {{Lien web}} pointant vers internet archive
- {{Lien brisé}} sans date dans « brisé le », remplacé par l'archive wikiwix déjà accessible avant modif :
- https://www.amazon.com/Samsung-Series-550-Chromebook-Wi-Fi/dp/tech-data/B007Y8DJ22/ref=de_a_smtd remplacé par https://archive.wikiwix.com/cache/index2.php?url=https%3A%2F%2Fwww.amazon.com%2FSamsung-Series-550-Chromebook-Wi-Fi%2Fdp%2Ftech-data%2FB007Y8DJ22%2Fref%3Dde_a_smtd (plusieurs archives Internet archive sont présentées sur https://web.archive.org/web/20260000000000*/https://www.amazon.com/Samsung-Series-550-Chromebook-Wi-Fi/dp/tech-data/B007Y8DJ22/ref=de_a_smtd)
On s'attendrait à un remplacement par l'archive wikiwix fonctionnelle, déjà archivée proche du moment de l'ajout, et à défaut un lien vers Internet archive, mais j'ai l'impression que c'est le contraire qui se passe. Sur cette modif :
- {{Lien web}} mort : toujours remplacé par un lien Internet archive
- {{Lien brisé}}
- si un champ « brisé le » est renseigné, il remplacé par un lien Internet archive
- sinon, il est remplacé par une archive wikiwix
Est-ce un comportement prévu ou un effet de bord quelconque ? - Lupin (discuter) 31 août 2026 à 13:50 (CEST)
- Comportement prévu. Le bot interroge Internet Archive, Wikiwix ensuite. Quand un « brisé le » fournit une date, la recherche est contrainte à une capture antérieure à cette date : Wikiwix n'expose pas de date de capture ni de moyen d'en sélectionner une, alors que Wayback le permet. S'y ajoutent d'autres contraintes techniques (pas d'API Wikiwix, cadence de requêtes…).
À noter que le bot n'a supprimé aucune archive Wikiwix : l'article n'en contenait aucune avant la modif — pas plus qu'aucune autre archive. Le bot en a ajouté sept, dont une Wikiwix (voir diff). Les liens Wikiwix que tu as vus disparaître n'étaient pas des archives, mais des liens de recherche générés à la volée par {{lien brisé}} : ils ne garantissent aucune capture et peuvent aboutir sur une page vide, une 404 ou une capture sans rapport (casino/porno). L'archive enregistrée par le bot, elle, est une capture qu'il a effectivement récupérée et dont il a vérifié le contenu.
On s'attendrait à un remplacement par l'archive wikiwix (…) et à défaut un lien vers Internet archive : c'est ton attente. Aucune règle ni discussion ne fixe de priorité entre archiveurs, l'ordre inverse est tout aussi défendable. Par exemple, le critère de pérennité attendue des archives à 10-20 ans, alors que Wikiwix a failli disparaitre et n'est presque pas maintenu.- — Irønie 31 août 2026 à 14:36 (CEST)
- À noter que le bot n'a supprimé aucune archive : en pratique, ça revient exactement au même, car le fonctionnement actuel de CodexBot aboutit à la suppression des archives wikiwix de 90% des liens morts, qu'ils soient des {{Lien web}} inaccessibles ou des {{Lien mort}} sans « brisé le ».
- Tu indiques que ce choix est assumé et qu'il n'y a pas de décision de la communauté pour fixer une priorité dans les archiveurs. Dans ce cas, y a-t-il une décision de la communauté qui entérine la suppression des archives wikiwix et leur remplacement par un lien internet archive ? - Lupin (discuter) 2 septembre 2026 à 16:55 (CEST)
- La communauté adore CodexBot. Donc ça va. Irønie 2 septembre 2026 à 18:02 (CEST)
- Salut @Irønie il n’est pas vrai que les années produisent des sages, elles ne produisent que des vieillards et dans notre lutte contre les bots//IAs on avait oublié les accès à l'api qu'on avait fourni à CodexBot ce changement date de 5 mois, l'ancienne api est de nouveau fonctionnelle :
- https://archive.wikiwix.com/cache/?url=http://linterweb.fr/&apiresponse=1
- Voilà la nouvelle qui est en cours de réalisation :
- https://gitlab.com/dev_linterweb/web-archiver/-/blob/master/cache/api.php?ref_type=heads
- Le service donne l'impression de n'être plus maintenu mais cela s'explique car le serveur est quasiment plein depuis 1 an on a bloqué les nouvelles pages hors liens externes de wikipedia et que tu ne peux pas savoir à quel point ces difficiles de rentrer des serveurs dans cette société qui se veut souveraine et que les IA nous prenait toutes les ressources.
- Chut on en est pas encore là, et maintenant qu'on a réagit continuons à nous cacher :
- https://siecledigital.fr/2026/05/05/pourquoi-des-centaines-de-medias-veulent-effacer-leurs-traces-dinternet/
- Ce n'est pas que je suis moins présent c'est que quand je vois venir une sale affaire, j’essaye de l’éviter, alors évitons d'en monter une.
- On m’a souvent dis que wikiwix ne tenait qu’à un fil, alors ne soit pas de ceux qui veulent le couper. Pmartin (discuter) 3 septembre 2026 à 23:34 (CEST)
- @Pmartin. Merci d'avoir rouvert l'accès pour CodexBot, et pour la transparence sur les contraintes côté serveur ; je comprends que ce ne soit pas simple.
- Sur le plan technique : faute d'API stable jusqu'ici, CodexBot bidouille directement les requêtes sur la mono-page (SPA). Il a de toute façon besoin du contenu de la page (vérification soft-404, parking…). L'API ne m'apporte pas de gain par rapport à ce bidouillage, donc je n'ai pas basculé dessus. Je garde un œil sur la nouvelle version en cours (le lien Gitlab), si elle simplifie les choses, je l'intégrerai.
- Pour le reste, Wikiwix est une belle idée. Mais le critère de pérennité est crucial pour des archives. Les objectifs et la santé de Wikipédia-fr priment pour moi.
- Sur le fond de ton inquiétude : non, CodexBot ne cherche pas à couper le fil. Hier, il a fait 1224 interrogations de Wikiwix, et il ajouté 379 URL Wikiwix en dur dans des articles, il a ajouté 300 {Lien brisé} (dont le gadget pointe vers Wayback/Wikwix).
- — Irønie 4 septembre 2026 à 09:47 (CEST)
- Ca fait deux nuit que j'essaye de comprendre ton problème, où tu m'insultes de "Commercial IT" : je copie colle tes réponses//questions
- "S'y ajoutent d'autres contraintes techniques (pas d'API Wikiwix, cadence de requêtes…)."
- => Merci d'avoir rouvert l'accès pour CodexBot, et pour la transparence sur les contraintes côté serveur ; je comprends que ce ne soit pas simple.
- "Il a de toute façon besoin du contenu de la page (vérification soft-404, parking…). L'API ne m'apporte pas de gain par rapport à ce bidouillage"
- Heu : elle sert à çà la nouvelle api : Discussion utilisateur:Pmartin#c-Framawiki-20260705223800-Bot de détection des sources brand content. Pmartin (discuter) 5 septembre 2026 à 04:55 (CEST)
- La communauté adore CodexBot. Donc ça va. Irønie 2 septembre 2026 à 18:02 (CEST)