Experimentelle FlyVis-OPTP-Demo · 10 Sekunden · Ohne Ton
Links sind ein Fliegenmodell und die Eingabebilder zu sehen. In der Mitte werden die Seitenklassifikationen des bisherigen und des neuen Modells verglichen. Rechts werden Merkmale und Projektionen entlang der horizontalen und der vertikalen Achse visualisiert. Wechselt die Eingabe, lassen sich die Vorhersagen beider Modelle vergleichen. Die in der Aufnahme gezeigten Laufzeiten im Browser können von den separat gemessenen internen Werten abweichen, um die es weiter unten geht.
Kann ein kleineres Modell besser sehen?
Die Seitenerkennung gehört zu den Grundlagen einer Buchscanner-App. Das vFlat-Entwicklungsteam hat damit experimentiert, das Seitenerkennungsmodell OPTP schlanker zu machen. Eine unerwartete Inspirationsquelle war die Forschung zum Sehsinn von Fruchtfliegen.
Dieser Artikel beschreibt ein Forschungs- und Entwicklungsexperiment, das am 15. September 2026 im Team vorgestellt wurde. Es handelt sich weder um die Ankündigung einer veröffentlichten vFlat-Funktion noch um eine auf verschiedenen Smartphones bestätigte Leistung.
Eine Idee übernehmen, kein Nervensystem kopieren
Der Entwickler hat sich an FlyVis orientiert, aber nicht den kompletten neuronalen Schaltkreis einer Fruchtfliege nachgebaut. Stattdessen übernahm das Experiment die Idee, Informationen getrennt entlang der horizontalen und der vertikalen Richtung zu eindimensionalen Darstellungen zu verdichten – angepasst an die Seitenerkennung.
Das bisherige Modell extrahierte Merkmale, während es ein zweidimensionales Bild schrittweise verkleinerte. Das neue Modell extrahiert zunächst schnell einfache zweidimensionale Merkmale und verdichtet sie dann zur weiteren Verarbeitung entlang der beiden Achsen. Ziel ist es, den Aufwand zu verringern, der entsteht, wenn durchgehend auf der vollständigen räumlichen Darstellung gerechnet wird.
Halb so viele Parameter, höhere Genauigkeit im internen Test
Im internen Test des Entwicklers stieg die Genauigkeit von 96,5 % auf 98,6 % – ein Plus von 2,1 Prozentpunkten. Die Zahl der Parameter sank etwa auf die Hälfte, der Rechenaufwand auf ungefähr ein Drittel.
Der Bericht verzeichnete außerdem eine Latenz von unter 1 ms, minimal 0,44 ms. Diese Ergebnisse gelten für diesen Versuchsaufbau. Messgerät, Laufzeitumgebung, Zahl der Wiederholungen und Zusammensetzung des Testdatensatzes werden hier nicht offengelegt. Die Zahlen sollten daher nicht auf die Geschwindigkeit auf einzelnen Smartphones oder die Genauigkeit im Alltag übertragen werden.
Das nächste Ziel: eine Mobil-CPU
Als Nächstes will der Entwickler das Modell direkt auf einer Mobil-CPU ausführen und so den Schritt vermeiden, Daten auf eine GPU zu übertragen. Weil das Modell weniger Rechenaufwand braucht, entsteht Spielraum, diesen Ausführungsweg zu erkunden.
Dass das Modell auf einer Mobil-CPU schnell genug läuft, ist bislang eine Hypothese, die noch geprüft werden muss. Die Latenz auf echten Geräten und die Genauigkeit unter verschiedenen Aufnahmebedingungen müssen erst noch validiert werden.
Ein größeres Modell ist nicht der einzige Weg
Spannend an diesem Experiment ist, dass sich das Ergebnis im internen Test verbessert hat, ohne dass das Modell größer wurde. Das Bemühen eines Entwicklers, eine Idee aus einem anderen Fachgebiet zu vereinfachen und auf ein konkretes Problem zuzuschneiden, hat einen möglichen Weg zu einer schlankeren Seitenerkennung aufgezeigt.
Text: vFlat-Entwicklungsteam. Zahlen und Implementierungsdetails beruhen auf dem internen Versuchsbericht des Entwicklers, der am 15. September 2026 vorgestellt wurde.