
Подразделение Apple Machine Learning Research представило новый набор данных под названием LVSum, предназначенный для оценки способности мультимодальных больших языковых моделей (MLLM) создавать резюме длинных видео. Основная сложность, которую призван решить этот проект, заключается в сохранении временной достоверности при работе с протяженными материалами, где модели часто теряют связь между семантическим содержанием и конкретными моментами времени.
Бенчмарк включает в себя 72 разнородных видеоролика, охватывающих 13 различных предметных областей. Средняя продолжительность каждого видео составляет 16 минут. Уникальной особенностью набора данных является наличие до 10 человеческих аннотаций-резюме для каждого ролика, которые содержат точные временные привязки, что позволяет проводить детальную оценку выравнивания текста и видеоряда.
Внедрение LVSum создает стандартизированную основу для тестирования алгоритмов, требующих не просто общего понимания сюжета, но и точного указания временных интервалов событий. Это отличается от предыдущих подходов, где акцент часто делался исключительно на семантической корректности без строгой проверки хронологической последовательности.
комментарий редакции
Что это значит
Вероятным следствием станет появление нового поколения моделей, оптимизированных специально для долгосрочной памяти и временной локализации событий. Следующим наблюдаемым сигналом станут публикации результатов тестирования ведущих открытых и закрытых моделей на этом бенчмарке. Однако остается неопределенность относительно того, насколько хорошо результаты на LVSum будут переноситься на реальные пользовательские сценарии с еще более длительным и менее структурированным контентом.