Post #705612
2026-03-16 13:32 UTC
Replies (8)
-
@BertrandCaron@digipres.club 2026-03-16 13:34
L'effort de préservation du web français, que l'institution mène depuis environ 2010 (avec des collections qui remontent jusqu'en 1996) est en péril. Seule solution que nos collègues envisagent jusqu'ici : contacter individuellement les producteurs pour leur expliquer la démarche et leur demander de lever les barrières. Autant vous dire que ça ne va pas marcher. 2/2
-
@archeenerd@digipres.club 2026-03-16 14:21
@BertrandCaron Effectivement, j'ai constaté ça aussi, les outils mis en place (Anubis chez nous) soulagent bien les serveurs face à la pression des robots mais les crawlers web "légitimes" sont des victimes collatérales de ces mesures. Du coup, des sites institutionnels ne peuvent de facto plus être archivés. Les guillemets autour de légitime sont volontaires, car qu'est-ce qui distingue (hors système de patte blanche) un robot légitime d'un robot illégitime? L'agressivité de la capture?
-
@mab@mastodon.xyz 2026-03-16 14:40
@BertrandCaron As-tu une idée de si c'est la cause du dysfonctionnement actuel de l'accès à EuroPresse auquel l'abonnement BnF permet habituellement d'accéder ?
-
@Poslovitch@wikis.world 2026-03-16 19:56
@BertrandCaron donc la BNF archive... Mon blog? :blobfoxwhaaaat:
-
@Tiflosion@rivals.space 2026-03-16 20:26
@BertrandCaron il faudrait un genre de systeme de confiance, la chose la plus simple à laquelle je pense serait un système de whitelist par ip vu qu'on suppose que des organismes tels que internet archive ont des ip fixes facilement identifiables
-
@bortzmeyer@mastodon.gougere.fr 2026-03-18 07:27
@BertrandCaron Oui, je me souviens il y a presque un an les gens de Common Crawl se plaignant de ça. Comme souvent en sécurité, les réactions irréfléchies aux problèmes causent davantage d'ennuis que les problèmes originels.
-
@sossalemaire@mamot.fr 2026-03-19 07:09
@BertrandCaron Vous n'y pouvez rien, mais en tant que développeur et hébergeur de sites webs, je peux vous dire que les scrappers sont un vrai problème. Mes sites publics se tapent du 90% de trafic de scrappers, et dès qu'on bloque, les serveurs respirent nettement mieux. Un petit rappel : nous faisons des sites pour que des humains les lisent, et surdimensionner l'hébergement et la consommation énergétique et matérielle correspondante pour accomoder des robots, ça me gonfle. Grave.
-
@benjo@androiddev.social 2026-03-20 07:18
@BertrandCaron il y a des gens qui réfléchissent à des solutions techniques alternatives pour remettre l'humain au centre du web. Par exemple cette proposition de webring (en anglais) par @mttaggart . L'idée étant de recréer des cercles de serveurs ayant confiance mutuellement les uns dans les autres. L'idée étant de vérifier à la fois identité et réputation. https://taggart-tech.com/ringspace/