Все о Цифровых системах - новости, статьи, обзоры, аналитика. Более 1000 компаний, товаров и услуг в каталоге.
Добавить компаниюПредложить публикацию

DeepSeek представляет мультимодальную языковую модель, не уступающую Opus 4.8

Рубрики: «Искусственный интеллект (AI)», «Языковые модели (LLM)»

DeepSeek представляет мультимодальную языковую модель

На момент запуска модель V4 Flash Vision Exp доступна только через платную платформу для разработчиков DeepSeek. Позже компания может выпустить бесплатную версию, учитывая, что многие из ее предыдущих моделей имеют открытый исходный код. К таким моделям относится V4 Flash — алгоритм, выпущенный в апреле этого года и ставший основой V4 Flash Vision Exp.

DeepSeek сравнила две большие языковые модели по семи тестам, включающим текстовые задания. Модель V4 Flash Vision Exp превзошла свою предшественницу по всем тестам, кроме одного. Этот тест, под названием Cybergym, оценивает способность больших языковых моделей обнаруживать уязвимости в программном обеспечении.

Наибольшее улучшение производительности V4 Flash Vision Exp демонстрирует в анализе изображений. Компания DeepSeek протестировала способность модели обрабатывать визуальный контент с помощью четырех различных тестов. В двух тестах новая модель набрала более чем на 10% больше баллов.

Примечательно, что V4 Flash Vision Exp также превзошла модель Opus 4.8 от компании Anthropic PBCC в двух визуальных тестах под названием ALE и ZeroBench. Первый тест включает более 1000 многоэтапных задач, требующих от больших языковых моделей взаимодействия с приложениями, написания кода и интерпретации медиафайлов. Второй тест (ZeroBench) содержит 100 задач по анализу изображений, которые представляют собой серьезную проблему для передовых больших языковых моделей.

DeepSeek не раскрывает информацию об архитектуре своей новой модели V4 Flash Vision Exp., однако на странице Hugging Face компании представлен подробный обзор модели V4 Flash, на основе которой создана последняя языковая модель. V4 Flash — это гибридная экспертная модель с 284 миллиардами параметров. Она состоит из нескольких нейронных сетей, каждая из которых содержит 13 миллиардов параметров. Когда пользователь вводит запрос, языковая модель активирует только ту нейронную сеть, которая лучше всего подходит для генерации ответа. Такой подход требует значительно меньше ресурсов, чем активация всей языковой модели.

Языковые модели хранят информацию, которую они используют для ответов на запросы, в структуре данных, называемой «кэшем ключ-значение» (KV-кэшем). Модель V4 Flash использует два метода сжатия KV-кэша: HCA и CSA. Метод CSA (Compressed Sparse Attention) - выполняет более легкое сжатие контекста (например, объединяет каждые 4 токена в одну запись). В свою очередь, метод HCA (Heavily Compressed Attention) - применяет более агрессивное сжатие (например, объединяет по 128 токенов в один блок). По данным DeepMind, эти технологии сокращают на 73% объем вычислительной мощности, необходимый для обработки подсказок с 1 миллионом токенов.

DeepSeek обучила модель V4 Flash на данных объемом 32 триллиона токенов. Для ускорения процесса обучения компания использовала алгоритм под названием Muon. Этот алгоритм сокращает время, необходимое для калибровки скрытых слоев больших языковых моделей — компонентов, которые выполняют основную часть обработки при ответах на запросы.

V4 Flash — одна из двух больших языковых моделей, выпущенных компанией DeepSeek в апреле этого года. Другая модель называется V4 Pro и имеет более чем в пять раз больше параметров. Учитывая, что V4 Flash Vision Exp создана на основе V4 Flash, возможно, что V4 Pro в конечном итоге также станет основой для специализированных моделей, оптимизированных для таких задач, как анализ изображений.

Источник: