Post #1168398
2026-04-03 18:50 UTC
Problème… j'arrive pas a trouver un crawler+index+search qui me convienne…
Y'a un monde où si j'y arrive je peut juste utiliser un index+search existant et faudrait juste que je fasse le crawler. Ça se tente.
J'ai un peu envie de faire un parseur de robots.txt de toute façon.
Après, j'ai juste a avoir… un navigateur web pour parser les pages… oups…
Replies (1)
-
@eragon@transfem.social 2026-04-03 18:56
Je veut pas du Java… par ce que ça bouffe tout de suite une tonne de ressources même si j'indexe rien. Java quoi… mais y'a plein de trucs qui se basent dessus. Y'a aussi plein de trucs "Elasticsearch" mais je veut pas ça non plus… Y'en a un qui ressemble pas mal a ce que je veut mais… il respecte pas les robots.txt (où en tout cas le mentionne pas…) du coup c'est pas trop mon truc non plus. Puis il fait plus archive qu'index. Je veut juste avoir les liens vers les sources, pas avoir mon propre cache (sauf éventuellement pour ce qui viendrai de Kiwix)