
Разработчики Hugging Face анонсировали расширение фреймворка RLVE, адаптировав его для многоэтапных разговоров в сфере электронной коммерции. Новая система, получившая название EcomRLVE-GYM, позволяет тестировать conversational agents не на одиночных логических задачах, а в сложных сценариях взаимодействия с инструментами.
Платформа предоставляет восемь верифицируемых сред, охватывающих ключевые процессы онлайн-торговли: от поиска товаров и подбора аналогов до формирования корзины, оформления возвратов и отслеживания заказов. Каждая среда оснащена процедурной генерацией задач и системой наград, проверяемой алгоритмически.
Для обучения моделей предусмотрена учебная программа сложности по 12 осям. Такой подход позволяет постепенно наращивать нагрузку на искусственный интеллект, отрабатывая как простые запросы о политике магазина, так и сложные маршруты с множественными намерениями пользователя.
комментарий редакции
Что это значит
Вероятным следствием станет появление более устойчивых к ошибкам торговых ботов, способных-handle сложные цепочки действий. Следующим наблюдаемым сигналом станет публикация бенчмарков производительности различных моделей в этой среде. Основную неопределенность составляет скорость адаптации существующих языковых моделей к требованиям многоэтапного планирования в рамках нового гимна.