Demo experimental de FlyVis OPTP · 10 segundos · Sin sonido

A la izquierda, un modelo de mosca y las imágenes de entrada. En el centro se comparan las clasificaciones de página del modelo actual y del nuevo. A la derecha se visualizan las características y las proyecciones en los ejes horizontal y vertical. Al cambiar la entrada, se pueden comparar las predicciones de los dos modelos. Los tiempos del navegador que aparecen en la grabación pueden diferir de las mediciones internas, independientes, que se comentan más abajo.

¿Puede un modelo más pequeño ver mejor?

Reconocer páginas es una parte básica de una app de escaneo de libros. El equipo de desarrollo de vFlat hizo pruebas para aligerar OPTP, su modelo de reconocimiento de páginas, y encontró la inspiración en un lugar inesperado: la investigación sobre la visión de la mosca de la fruta.

Este artículo describe un experimento de investigación y desarrollo que se compartió con el equipo el 15 de septiembre de 2026. No es el anuncio de una función de vFlat ya publicada ni de un rendimiento verificado en distintos móviles.

Tomar prestada una idea, no copiar un sistema nervioso

El desarrollador se basó en FlyVis, pero no copió un circuito neuronal completo de la mosca de la fruta. En su lugar, el experimento tomó una idea —comprimir la información por separado en horizontal y en vertical, en representaciones unidimensionales— y la adaptó al reconocimiento de páginas.

El modelo actual extraía características mientras reducía progresivamente una imagen bidimensional. El nuevo modelo primero extrae rápidamente características bidimensionales sencillas y después las comprime a lo largo de los dos ejes para procesarlas. El objetivo es reducir el trabajo de seguir calculando sobre la representación espacial completa.

La mitad de parámetros y más precisión en las pruebas internas

En la prueba interna del desarrollador, la precisión pasó del 96,5 % al 98,6 %, una mejora de 2,1 puntos porcentuales. El número de parámetros se redujo aproximadamente a la mitad, y la carga de cálculo bajó a cerca de un tercio.

El informe también registró una latencia inferior a 1 ms, con un mínimo de 0,44 ms. Estos resultados corresponden a esa configuración experimental. Aquí no se detallan el dispositivo de medición, el entorno de ejecución, el número de repeticiones ni la composición del conjunto de prueba, así que estas cifras no deben generalizarse a la velocidad en cada móvil ni a la precisión en el uso diario.

El siguiente objetivo: una CPU móvil

El próximo objetivo del desarrollador es ejecutar el modelo directamente en una CPU móvil, sin el paso de trasladar los datos a una GPU. Reducir la carga de cálculo del modelo abre la puerta a explorar esta vía de ejecución.

Que el rendimiento en una CPU móvil sea lo bastante rápido sigue siendo una hipótesis por comprobar. Aún hay que validar la latencia en dispositivos reales y la precisión en distintas condiciones de captura.

Un modelo más grande no es el único camino

Lo interesante de este experimento es que el resultado de la prueba interna mejoró sin hacer el modelo más grande. El esfuerzo de un desarrollador por simplificar una idea de otro campo y adaptarla a un problema concreto ha mostrado una posible vía hacia un reconocimiento de páginas más ligero.

Artículo: equipo de desarrollo de vFlat. Las cifras y los detalles de implementación se basan en el informe experimental interno del desarrollador, compartido el 15 de septiembre de 2026.