Elektrine lite

← Feed

@BertrandCaron@digipres.club

Post #705612

2026-03-16 13:32 UTC

Nouvel effet secondaire pervers du pillage massif du web par les entreprises d'IA (oui parce que je pense que vous n'étiez pas assez en colère déjà). Une de mes collègues en charge du dépôt légal du web à la #BnF nous signale que, face à cette menace, les sites se barricadent de plus en plus. Résultat : les robots de la BnF se retrouvent le bec dans l'eau. Les collectes sont massivement en échec. 1/2

Replies (8)

  • @BertrandCaron@digipres.club 2026-03-16 13:34

    L'effort de préservation du web français, que l'institution mène depuis environ 2010 (avec des collections qui remontent jusqu'en 1996) est en péril. Seule solution que nos collègues envisagent jusqu'ici : contacter individuellement les producteurs pour leur expliquer la démarche et leur demander de lever les barrières. Autant vous dire que ça ne va pas marcher. 2/2

    Open ##1478333

  • @archeenerd@digipres.club 2026-03-16 14:21

    @BertrandCaron Effectivement, j'ai constaté ça aussi, les outils mis en place (Anubis chez nous) soulagent bien les serveurs face à la pression des robots mais les crawlers web "légitimes" sont des victimes collatérales de ces mesures. Du coup, des sites institutionnels ne peuvent de facto plus être archivés. Les guillemets autour de légitime sont volontaires, car qu'est-ce qui distingue (hors système de patte blanche) un robot légitime d'un robot illégitime? L'agressivité de la capture?

    Open ##1478358

  • @mab@mastodon.xyz 2026-03-16 14:40

    @BertrandCaron As-tu une idée de si c'est la cause du dysfonctionnement actuel de l'accès à EuroPresse auquel l'abonnement BnF permet habituellement d'accéder ?

    Open ##1478368

  • @Poslovitch@wikis.world 2026-03-16 19:56

    @BertrandCaron donc la BNF archive... Mon blog? :blobfoxwhaaaat:

    Open ##1478373

  • @Tiflosion@rivals.space 2026-03-16 20:26

    @BertrandCaron il faudrait un genre de systeme de confiance, la chose la plus simple à laquelle je pense serait un système de whitelist par ip vu qu'on suppose que des organismes tels que internet archive ont des ip fixes facilement identifiables

    Open ##1478387

  • @BertrandCaron Oui, je me souviens il y a presque un an les gens de Common Crawl se plaignant de ça. Comme souvent en sécurité, les réactions irréfléchies aux problèmes causent davantage d'ennuis que les problèmes originels.

    Open ##1478391

  • @sossalemaire@mamot.fr 2026-03-19 07:09

    @BertrandCaron Vous n'y pouvez rien, mais en tant que développeur et hébergeur de sites webs, je peux vous dire que les scrappers sont un vrai problème. Mes sites publics se tapent du 90% de trafic de scrappers, et dès qu'on bloque, les serveurs respirent nettement mieux. Un petit rappel : nous faisons des sites pour que des humains les lisent, et surdimensionner l'hébergement et la consommation énergétique et matérielle correspondante pour accomoder des robots, ça me gonfle. Grave.

    Open ##1478392

  • @benjo@androiddev.social 2026-03-20 07:18

    @BertrandCaron il y a des gens qui réfléchissent à des solutions techniques alternatives pour remettre l'humain au centre du web. Par exemple cette proposition de webring (en anglais) par @mttaggart . L'idée étant de recréer des cercles de serveurs ayant confiance mutuellement les uns dans les autres. L'idée étant de vérifier à la fois identité et réputation. https://taggart-tech.com/ringspace/

    Open ##1478395