
Apple Machine Learning Research の研究部門が、Length Value Model(LenVM)に関する論文を発表した。同文書では、トークンが現代の自己回帰モデルにおける計算の基本単位であり、生成長が出力コストと推論品質に直接影響を与えると主張されている。
著者らは、既存のアプローチが主にシーケンス全体レベルで動作し、詳細な長さのモデリングを欠いていることが多いと指摘している。新たな開発である LenVM は、デコーディングの各個別ステップにおいて残りの生成長をモデル化するトークンレベルのフレームワークである。
提案された手法は、生成プロセスに対するより細粒度の制御により、現在のアプローチにおけるギャップを解消することを目的としている。これにより、システムはプロセス開始時だけでなく、回答が形成されるにつれて必要な出力量を動的に評価できるようになる。
編集部コメント
なぜ重要か
トークンレベルの長さモデリングの導入は、大規模モデルの展開における運用コストの削減につながる可能性がある。次に観察される兆候は、独立したテストの出現またはオープンなフレームワークへの類似メカニズムの統合となるだろう。主な不確実性は、複雑なシナリオにおける実際の動作速度と長さ予測の精度に関するデータが不足している点にある。