FlyVis OPTPの実験デモ · 10秒 · 音声なし
左側にはハエのモデルと入力画像、中央には既存モデルと新モデルのページ分類結果、右側には特徴の可視化と横・縦方向の投影が表示されます。入力画像が切り替わるたびに、両モデルの判断を比較できます。映像内のブラウザでの実行時間は、本文で紹介する別の内部測定値とは異なる場合があります。
小さなモデルで、もっと正確に認識できるか
本をスキャンするアプリにとって、ページの認識は基本となる処理です。vFlat開発チームは、この処理を担うOPTPページ認識モデルを軽くする実験に取り組みました。ヒントは、ショウジョウバエの視覚を扱う研究にありました。
この記事は、2026年9月15日にチーム内で共有された研究開発の実験を紹介するものです。公開済みのvFlatの機能や、あらゆるスマートフォンで検証された性能を示すものではありません。
神経回路のコピーではなく、アイデアを応用する
開発者はFlyVisを参考にしましたが、ショウジョウバエの神経回路全体をそのまま使用したわけではありません。横方向と縦方向の情報をそれぞれ1次元に圧縮するアイデアを、ページ認識に合わせて採用しました。
既存モデルは2次元の画像を段階的に縮小しながら特徴を抽出していました。新モデルは、まず2次元で簡単な特徴を素早く抽出し、横・縦方向に圧縮して処理します。空間全体の情報を計算し続ける負担を減らすための設計です。
パラメータは半分、内部テストの精度は向上
開発者が報告した内部テストでは、精度が96.5%から98.6%へ、2.1ポイント向上しました。パラメータ数は約半分、計算量は約3分の1に減りました。
内部測定では1ms未満、最小0.44msの遅延時間も報告されています。これは、その実験環境で得られた結果です。測定機器、実行環境、反復回数、テストセットの構成は本記事では公開していないため、個々のスマートフォンでの速度や日常利用での精度に一般化することはできません。
次の目標はモバイルCPU
開発者が次に目指すのは、GPUにデータを移す工程を省き、モバイルCPUで直接処理することです。モデルの計算量を減らせば、このような実行方法を試す余地が生まれます。
モバイルCPUで十分に速く動くという見通しは、まだ検証すべき仮説です。実機での遅延時間や、さまざまな撮影条件での精度を確かめる必要があります。
大きなモデルだけが答えではない
この実験の興味深い点は、モデルを大きくせずに内部テストの結果を改善したことです。別の分野のアイデアを課題に合わせてシンプルに応用する試みが、より軽いページ認識への可能性を示しました。
記事:vFlat開発チーム。数値と実装の説明は、2026年9月15日に開発者が共有した内部実験報告に基づきます。