Demo eksperimen FlyVis OPTP · 10 detik · Tanpa suara

Di sebelah kiri ada model lalat dan gambar input. Bagian tengah membandingkan klasifikasi halaman dari model lama dan model baru. Bagian kanan memvisualisasikan fitur dan proyeksi di sepanjang sumbu horizontal dan vertikal. Saat input berubah, prediksi kedua model dapat dibandingkan. Waktu proses di browser yang tampak dalam rekaman bisa berbeda dari pengukuran internal terpisah yang dibahas di bawah.

Bisakah model yang lebih kecil melihat lebih baik?

Mengenali halaman adalah bagian mendasar dari aplikasi pemindai buku. Tim pengembang vFlat bereksperimen untuk membuat model pengenalan halaman OPTP menjadi lebih ringan. Sumber inspirasinya tak terduga: riset tentang penglihatan lalat buah.

Artikel ini membahas eksperimen riset dan pengembangan yang dibagikan kepada tim pada 15 September 2026. Ini bukan pengumuman fitur vFlat yang sudah dirilis, dan performanya pun belum diverifikasi di berbagai ponsel.

Meminjam ide, bukan meniru sistem saraf

Pengembangnya merujuk pada FlyVis, tetapi tidak menyalin seluruh sirkuit saraf lalat buah. Eksperimen ini mengadopsi gagasan untuk memadatkan informasi secara terpisah di arah horizontal dan vertikal menjadi representasi satu dimensi, lalu menyesuaikannya untuk pengenalan halaman.

Model lama mengekstraksi fitur sambil memperkecil gambar dua dimensi secara bertahap. Model baru lebih dulu mengekstraksi fitur dua dimensi sederhana dengan cepat, lalu memadatkannya di sepanjang dua sumbu untuk diproses. Tujuannya adalah mengurangi beban komputasi yang harus terus dijalankan pada seluruh representasi spasial.

Parameter berkurang separuh, akurasi uji internal naik

Dalam uji internal pengembang, akurasi naik dari 96,5% menjadi 98,6%, atau 2,1 poin persentase. Jumlah parameter berkurang kira-kira separuhnya, dan beban komputasi turun menjadi sekitar sepertiga.

Laporan itu juga mencatat latensi di bawah 1 ms, dengan nilai minimum 0,44 ms. Hasil ini hanya berlaku untuk kondisi eksperimen tersebut. Perangkat pengukuran, runtime, jumlah pengulangan, dan komposisi data uji tidak diungkapkan di sini, sehingga angka-angka ini tidak dapat dianggap mewakili kecepatan di tiap ponsel atau akurasi dalam penggunaan sehari-hari.

Target berikutnya: CPU ponsel

Target pengembang berikutnya adalah menjalankan model langsung di CPU ponsel, tanpa langkah memindahkan data ke GPU. Berkurangnya beban komputasi model membuka ruang untuk menjajaki jalur eksekusi ini.

Performa yang cukup cepat di CPU ponsel masih berupa hipotesis yang perlu diuji. Latensi di perangkat nyata dan akurasi dalam berbagai kondisi pemotretan masih perlu divalidasi.

Model lebih besar bukan satu-satunya jalan

Yang membuat eksperimen ini menarik adalah hasil uji internalnya membaik tanpa harus memperbesar model. Upaya seorang pengembang untuk menyederhanakan ide dari bidang lain dan menyesuaikannya dengan masalah tertentu telah menunjukkan satu kemungkinan cara untuk membuat pengenalan halaman lebih ringan.

Ditulis oleh tim pengembang vFlat. Angka dan detail implementasi didasarkan pada laporan eksperimen internal pengembang yang dibagikan pada 15 September 2026.