Portia durchkämmt Webinhalte

Die Software Portia steht lässt sich nun als Open-Source-Software herunterladen. Mit ihrer Hilfe kann ein Benutzer neue Inhalte auf Webseiten auch ohne RSS-Feed im Auge behalten.

Immer mehr Webseiten verzichten darauf, einen RSS-Feed anzubieten, was es Benutzern unnötig schwer macht, den Inhalten der Seite zu folgen. Hier kommt Portia ins Spiel. Die Software steht jetzt unter der BSD-Lizenz und basiert auf Scrapy, einem quelloffenen Web-Crawling-Framework. Portia bringt ein Web-UI mit, das der Admin über einen Twisted-Server aufsetzt. Als Clients kommen aktuelle Version von Firefox und Chrome in Frage, geschrieben ist Portia in Python 2.7.

Ein Video auf Vimeo zeigt, wie der Anwender die Software bedient. Hat er etwa eine bestimmte News im Visier, weist er den einzelnen Elementen, also der Überschrift, dem Datum, der Nachricht selbst Labels zu. Dank eines Features namens Autoscraping muss er dafür keine Programmierkenntnisse mitbringen, sondern erledigt die Arbeit über ein visuelles Tool. Portia erkennt Muster im Quellcode und kann weitere News auf der Webseite selbstständig identifizieren.

Neben der Software, die der Admin aus einem Github-Repository herunterlädt und selbst installiert, wollen die Macher der Webseite Scrapinghub ihre Webcrawling-Software zukünftig als Dienst anbieten.

E-Mail Benachrichtigung
Benachrichtige mich zu:
0 Kommentare
Älteste
Neuste Beste Bewertung
Paul Black
8 Jahre her

Soweit ich weiß, http://www.octoparse.com/ und import.io auch Netzwerkdienste zu kriechen bieten.

Nach oben