Demo sperimentale FlyVis OPTP · 10 secondi · Senza audio

A sinistra ci sono un modello di mosca e le immagini in ingresso. Al centro si confrontano le classificazioni delle pagine del modello esistente e di quello nuovo. A destra sono visualizzate le caratteristiche e le proiezioni lungo l’asse orizzontale e quello verticale. Al variare dell’input si possono confrontare le previsioni dei due modelli. I tempi del browser mostrati nella registrazione possono differire dalle misurazioni interne separate di cui si parla più avanti.

Un modello più piccolo può vedere meglio?

Riconoscere le pagine è una funzione di base per un’app che scansiona libri. Il team di sviluppo di vFlat ha fatto alcuni esperimenti per alleggerire OPTP, il modello di riconoscimento delle pagine, e l’ispirazione è arrivata da una fonte inattesa: la ricerca sulla vista del moscerino della frutta.

Questo articolo descrive un esperimento di ricerca e sviluppo condiviso con il team il 15 settembre 2026. Non è l’annuncio di una funzione di vFlat già rilasciata né di prestazioni verificate sui vari telefoni.

Prendere in prestito un’idea, non copiare un sistema nervoso

Lo sviluppatore ha preso come riferimento FlyVis, ma non ha copiato un intero circuito neurale del moscerino. L’esperimento ha invece adottato l’idea di comprimere separatamente le informazioni lungo la direzione orizzontale e quella verticale in rappresentazioni unidimensionali, adattandola al riconoscimento delle pagine.

Il modello esistente estraeva le caratteristiche riducendo progressivamente un’immagine bidimensionale. Il nuovo modello estrae prima, in modo rapido, semplici caratteristiche bidimensionali, poi le comprime lungo i due assi per elaborarle. L’obiettivo è ridurre il carico di lavoro che comporterebbe continuare a fare calcoli sull’intera rappresentazione spaziale.

Metà dei parametri, accuratezza più alta nei test interni

Nel test interno dello sviluppatore, l’accuratezza è salita dal 96,5% al 98,6%, con un miglioramento di 2,1 punti percentuali. Il numero di parametri si è all’incirca dimezzato e il carico di calcolo è sceso a circa un terzo.

Il report ha registrato anche una latenza inferiore a 1 ms, con un minimo di 0,44 ms. Questi risultati si riferiscono a quella configurazione sperimentale. Il dispositivo di misurazione, il runtime, il numero di ripetizioni e la composizione del set di test non sono resi noti qui, quindi questi numeri non vanno presi come indicativi della velocità sui singoli telefoni o dell’accuratezza nell’uso quotidiano.

Il prossimo obiettivo: una CPU mobile

Il prossimo obiettivo dello sviluppatore è eseguire il modello direttamente su una CPU mobile, evitando il passaggio dei dati a una GPU. Alleggerire il carico di calcolo del modello rende possibile esplorare questa strada.

Che una CPU mobile sia abbastanza veloce resta un’ipotesi da verificare. La latenza sui dispositivi reali e l’accuratezza in diverse condizioni di ripresa devono ancora essere convalidate.

Un modello più grande non è l’unica strada

L’aspetto interessante di questo esperimento è che il risultato del test interno è migliorato senza ingrandire il modello. L’impegno di uno sviluppatore nel semplificare un’idea presa da un altro campo e adattarla a un problema specifico ha indicato una possibile strada verso un riconoscimento delle pagine più leggero.

A cura del team di sviluppo di vFlat. Dati e dettagli di implementazione si basano sul report sperimentale interno dello sviluppatore condiviso il 15 settembre 2026.