
Компания DeepSeek выпустила четвертую версию своих языковых моделей, представив два новых чекпоинта архитектуры MoE на платформе Hugging Face. Модель DeepSeek-V4-Pro обладает общим количеством параметров 1,6 триллиона, из которых активны 49 миллиардов, а версия DeepSeek-V4-Flash имеет 284 миллиарда общих и 13 миллиардов активных параметров. Ключевой особенностью обеих разработок стало наличие окна контекста размером в один миллион токенов.
Согласно опубликованным данным, показатели новых моделей в стандартных тестах являются конкурентоспособными, но не достигают уровня лучших мировых аналогов (SOTA). Однако разработчики подчеркивают, что это не является недостатком, так как главная инновация заключается в архитектуре, оптимизированной для эффективной поддержки большой длины контекста.
Такой подход позиционирует DeepSeek V4 как одного из наиболее подходящих кандидатов для выполнения агентных задач, где способность обрабатывать и удерживать в памяти обширные объемы информации важнее скоростных показателей в узкоспециализированных бенчмарках.
комментарий редакции
Что это значит
Вероятным последствием станет рост интереса к агентным архитектурам, способным обрабатывать большие данные внутри контекстного окна, а не через внешние векторные базы. Следующим наблюдаемым сигналом станут практические демонстрации работы агентов на базе V4 в реальных задачах. Основной неопределенностью остается баланс между скоростью вывода и стоимостью обработки такого огромного контекста в продакшене.