
La division de recherche Apple Machine Learning Research a publié un travail consacré au modèle Length Value Model (LenVM). Le document affirme que le token est l'unité fondamentale de calcul dans les modèles autorégressifs modernes, et que la longueur de la génération influence directement le coût de l'inférence et la qualité du raisonnement.
Les auteurs notent que les approches existantes manquent souvent d'une modélisation détaillée de la longueur, opérant principalement au niveau des séquences dans leur ensemble. Le nouveau développement LenVM représente un cadre au niveau des tokens qui modélise la longueur restante de la génération à chaque étape individuelle de décodage.
La méthode proposée vise à combler les lacunes des approches actuelles grâce à un contrôle plus granulaire du processus de génération. Cela permet au système d'évaluer dynamiquement le volume de sortie nécessaire au fur et à mesure de la formation de la réponse, et non seulement au début du processus.
commentaire éditorial
Pourquoi c’est important
L'introduction de la modélisation de la longueur au niveau des tokens pourrait entraîner une réduction des coûts opérationnels liés au déploiement de grands modèles. Le prochain signal observable sera l'apparition de tests indépendants ou l'intégration de mécanismes similaires dans des cadres open source. La principale incertitude réside dans l'absence de données sur la vitesse réelle d'exécution et la précision des prédictions de longueur dans des scénarios complexes.