Démo expérimentale FlyVis OPTP · 10 secondes · Sans son

À gauche, un modèle de mouche et les images d’entrée. Au centre, la comparaison des classifications de pages du modèle existant et du nouveau modèle. À droite, la visualisation des caractéristiques et de leurs projections selon les axes horizontal et vertical. Quand l’entrée change, on peut comparer les prédictions des deux modèles. Les durées mesurées dans le navigateur, visibles dans l’enregistrement, peuvent différer des mesures internes distinctes évoquées plus bas.

Un modèle plus petit peut-il mieux voir ?

Reconnaître les pages est une fonction de base pour une app de scan de livres. L’équipe de développement vFlat a cherché à alléger OPTP, son modèle de reconnaissance de pages. Source d’inspiration inattendue : la recherche sur la vision de la drosophile.

Cet article présente une expérience de recherche et développement partagée avec l’équipe le 15 septembre 2026. Il ne s’agit ni de l’annonce d’une fonctionnalité de vFlat déjà disponible, ni de performances vérifiées sur différents téléphones.

Emprunter une idée, pas copier un système nerveux

Le développeur s’est appuyé sur FlyVis, sans pour autant copier l’intégralité d’un circuit neuronal de drosophile. L’expérience a plutôt repris une idée — compresser l’information séparément selon les directions horizontale et verticale en représentations unidimensionnelles — en l’adaptant à la reconnaissance de pages.

Le modèle existant extrayait des caractéristiques en réduisant progressivement une image bidimensionnelle. Le nouveau modèle extrait d’abord rapidement des caractéristiques bidimensionnelles simples, puis les compresse selon les deux axes pour les traiter. Objectif : réduire les calculs qui continuent de porter sur l’ensemble de la représentation spatiale.

Deux fois moins de paramètres, une meilleure précision en test interne

Lors du test interne du développeur, la précision est passée de 96,5 % à 98,6 %, soit un gain de 2,1 points. Le nombre de paramètres a été divisé par deux environ, et la charge de calcul ramenée à un tiers environ.

Le rapport fait aussi état d’une latence inférieure à 1 ms, avec un minimum de 0,44 ms. Ces résultats valent pour ce protocole expérimental. L’appareil de mesure, l’environnement d’exécution, le nombre de répétitions et la composition du jeu de test ne sont pas précisés ici : ces chiffres ne doivent donc pas être généralisés à la vitesse sur un téléphone donné ni à la précision en usage courant.

Prochain objectif : le CPU mobile

Le prochain objectif du développeur est d’exécuter le modèle directement sur le CPU d’un mobile, en évitant l’étape de transfert des données vers un GPU. Alléger la charge de calcul du modèle permet d’explorer cette piste.

Une exécution assez rapide sur CPU mobile reste une hypothèse à vérifier. La latence sur de vrais appareils et la précision dans différentes conditions de prise de vue doivent encore être validées.

Un modèle plus gros n’est pas la seule voie

Ce qui rend cette expérience intéressante, c’est que le résultat du test interne s’est amélioré sans que le modèle grossisse. L’effort d’un développeur pour simplifier une idée venue d’un autre domaine et l’adapter à un problème précis a esquissé une piste vers une reconnaissance de pages plus légère.

Rédaction : l’équipe de développement vFlat. Les chiffres et les détails de mise en œuvre s’appuient sur le rapport d’expérience interne du développeur, partagé le 15 septembre 2026.