Das Tool Ssscrape sammelt Daten aus RSS- und Atom-Feeds, Blogs und Podcasts. Nun ist die Open-Source-Software in Version 1.0 verfügbar .
Ssscrape prüft Feeds und andere Sammlungen von gleichartigen Elementen auf Aktualisierungen, lädt Inhalte herunter und bereinigt diese, indem es etwa aus HTML Plaintext macht. Zur Datenspeicherung dient eine MySQL-Datenbank. Außerdem kann das Tool Statistiken über die Aktivität der Feeds und Fehlermeldungen führen. Ein Scheduler sorgt für regelmäßige Aufrufe, ein Monitor zeigt die laufenden Aktivitäten.
Umgangssprachlich Web Scraper genannt – ein Programm, das Informationen aus dem Web zusammenkratzt – steht hinter dem Namen Ssscrape das Wortungetüm “Syndicated and Semi-Structured Content Retrieval and Processing Environment”. Der Web Scraper ist in Python umgesetzt, für die Netzwerkprogrammierung kommt Twisted zum Einsatz, zum Parsen der nicht immer standardkonformen HTML-Inhalte dient Beautiful Soup.
Ssscrape wird am Institut für Informations- und Sprachverarbeitung an der Universität Amsterdam entwickelt und ist unter LGPLv3 lizenziert. Ssscrape 1.0 setzt Python 2.4 voraus und steht auf der Projektseite zum Download als Tarball bereit.



