Das neue Trainingsdatenset ChartNet, entworfern von Forschern des MIT und des MIT-IBM Computing Research Lab, könnte die Genauigkeit von Vision-Language-Modellen (VLM) verbessern, die bei der Analyse von Geschäftstrends oder der Interpretation wissenschaftlicher Abbildungen helfen.
Bisherige Bild-Sprach-Modelle haben mit der Interpretation von Charts zuweilen noch Schwierigkeiten, setzt die Aufgabe doch visuelles, numerisches und linguistisches Verständnis gleichzeitig voraus. Die Forscher verwendeten nun eine neuartige Methode zur Datengenerierung, um einen hochmodernen Datensatz zu erstellen, der mehr als eine Million vielfältiger Diagramme umfasst. Der Datensatz kodiert zudem zahlreiche visuelle, sprachliche und numerische Komponenten jedes Diagrammbildes, was es Modellen ermöglicht, robuste Schlussfolgerungen über die in einem Diagramm enthaltenen Informationen zu ziehen.
Das Datenset steht unter einer Open-Source-Lizenz, was es auch kleineren Firmen ermöglichen soll, Lösungen für die Trendanalyse oder Zusammenfassung von Diagrammen zu schaffen. Die Forscher trainierten damit selber eine Reihe quelloffener Bild-Sprach-Modelle, die danach um Größenordnungen mächtigere, kommerzielle Modelle bei entsprechenden Aufgaben übertrafen.
“Wir haben ChartNet als One-Stop-Shop für das Chart-Verständnis entwickelt, der im Grunde alles abdeckt, was ein KI-Modell und ein Praktiker, der dieses Modell trainiert, möglicherweise benötigt. Wir hoffen, dass unsere Arbeit die Forscher motiviert, mit kleineren Modellen, die keine unendlichen Mengen an Berechnungen erfordern, hohe Leistungen zu erzielen”, sagt Jovana Kondic, Doktorandin des MIT Electrical Engineering and Computer Science (ECS) und Hauptautorin eines Artikels über ChartNet.





