FlyVis OPTP 實驗示範 · 10 秒 · 無聲

左側是果蠅模型和輸入影像,中間比較既有模型與新模型的頁面分類結果,右側則以視覺化方式呈現特徵,以及特徵沿水平軸和垂直軸的投影。隨著輸入改變,可以比較兩個模型的預測。錄影中顯示的瀏覽器執行時間,可能與下文提到的另一項內部測量結果不同。

更小的模型,能看得更好嗎?

辨識頁面是書籍掃描 App 的基本功。vFlat 開發團隊嘗試讓 OPTP 頁面辨識模型變得更輕巧,而意想不到的靈感來源,竟是果蠅視覺的研究。

本文介紹的是 2026 年 9 月 15 日與團隊分享的一項研發實驗,並不是 vFlat 已推出功能的公告,也不代表已在各款手機上驗證過的效能。

借用的是想法,而不是照搬神經系統

開發者參考了 FlyVis,但並沒有照搬整套果蠅神經迴路,而是採用其中一個想法:把資訊分別沿水平和垂直方向壓縮成一維表示,並調整成適合頁面辨識的形式。

既有模型是在逐步縮小二維影像的過程中擷取特徵;新模型則先快速擷取簡單的二維特徵,再沿兩個軸向壓縮後處理。目的是減少持續對完整空間表示進行運算的工作量。

參數減半,內部測試準確率更高

在開發者的內部測試中,準確率從 96.5% 提升到 98.6%,增加了 2.1 個百分點。參數量約減少一半,運算量則降到約三分之一。

報告中也記錄到低於 1 毫秒的延遲,最低為 0.44 毫秒。這些結果僅適用於該實驗設定。由於本文並未公開測量裝置、執行環境、重複次數和測試集組成,這些數字不應推論為個別手機上的速度,或日常使用時的準確率。

下一個目標:行動裝置 CPU

開發者的下一個目標,是讓模型直接在行動裝置的 CPU 上執行,省去把資料搬到 GPU 的步驟。降低模型的運算量,就為探索這條執行路徑留出了空間。

行動裝置 CPU 能否跑得夠快,仍是有待檢驗的假設。實機上的延遲,以及在各種拍攝條件下的準確率,也都還需要驗證。

把模型做大,不是唯一的方向

這項實驗有趣的地方在於,模型並沒有變大,內部測試結果卻提升了。一位開發者把其他領域的想法化繁為簡、套用到特定問題上,讓我們看見一條讓頁面辨識更輕巧的可能途徑。

撰文:vFlat 開發團隊。數據與實作細節依據開發者於 2026 年 9 月 15 日分享的內部實驗報告。