Все о Цифровых системах - новости, статьи, обзоры, аналитика. Более 1000 компаний, товаров и услуг в каталоге.
Добавить компаниюПредложить публикацию

Mistral запускает языковую модель Mistral Large 4 с открытым исходным кодом

Рубрики: «Искусственный интеллект (AI)», «Языковые модели (LLM)»

Mistral запускает языковую модель Mistral Large 4 с открытым исходным кодом

На момент запуска LLM доступна в режиме публичного предварительного тестирования на облачной платформе компании. Mistral планирует опубликовать весовые коэффициенты модели в конце этого месяца.

Языковая модель Mistral Large 4 представляет собой смешанную экспертную архитектуру с 1 триллионом параметров. Одновременно используется только 49 миллиардов параметров, что более эффективно с точки зрения аппаратного обеспечения, чем активация всей модели при вводе запроса пользователем. Компания говорит, что LLM может отвечать на вопросы на более чем 160 языках.

Новая модель вошла в пятерку лучших по индексу AA Cyber Index — набору бенчмарков, которые измеряют способность больших языковых моделей находить и устранять уязвимости в программном обеспечении. Модель особенно хорошо справляется с исправлением ошибок в проектах с открытым исходным кодом. Mistral Large 4 набрала в этой области 82% баллов по индексу AA Cyber Index, опередив конкурирующие модели с открытым исходным кодом.

По словам представителей Mistral, еще одна сильная сторона их большой языковой модели это компьютерное зрение. Она превзошла GPT-6 Astra от OpenAI на 1% в тесте Dense200, который измеряет способность моделей находить интересующие объекты на изображениях. При этом Mistral Large 4 значительно отстает от передовых моделей, таких как Astra, в самых популярных тестах на кодирование в индустрии ИИ. Однако она превосходит несколько ведущих больших языковых моделей с открытым исходным кодом, включая Qwen3.8 Max и DeepSeek V4 Pro. Кроме того, Mistral Large 4 набрала больше баллов, чем предыдущая модель, в тестах AutomationBench и AA-Briefcase. Первый тест включает в себя относительно простые задачи, а второй — задания, на выполнение которых у человека ушли бы недели.

Компания Mistral обучила свою новую модель на 3800 чипах Grace Blackwell. Каждый ускоритель сочетает в себе две видеокарты Nvidia Blackwell и один центральный процессор. Компания не уточнила, сколько времени занял процесс обучения. Однако она поделилась другими подробностями проекта.

Усовершенствованные большие языковые модели обучаются методом проб и ошибок. Разрабатываемая модель получает задачу и пытается выполнить ее без участия человека. Каждое такое упражнение называется этапом развертывания. По завершении этапа развертывания специализированная модель искусственного интеллекта анализирует результаты и использует их для усовершенствования LLM. По данным компании Mistral, её инженеры разработали программный комплекс, способный параллельно запускать десятки тысяч развертываний. Этот комплекс собирает развертывания из библиотеки строительных блоков искусственного интеллекта. Эти блоки (модули) включают в себя:

  • песочницы, в которых языковые модели могут запускать код,
  • поисковую систему, облегчающую доступ к веб-ресурсам,
  • и тесты для проверки результатов развертывания.

Этот программный комплекс и был использован для разработки Mistral Large 4.

При развертывании модели генерировалось 33 миллиарда токенов в день. Компания Mistral использовала чуть меньше половины этих токенов для обучения, которое было необходимо для доработки Large 4. Развертывание и обучение проходили асинхронно, то есть задержка в одной рабочей нагрузке не замедляла другую. Это помогло Mistral ускорить обработку данных.

Примечательно, что после создания текущей версии модели компания не приостановила процесс обучения Mistral Large 4. В компании рассчитывают, что в ближайшие месяцы этот процесс позволит создать более крупные и функциональные версии больших языковых моделей. В долгосрочной перспективе компания будет использовать Mistral Large 4 для создания целой серии моделей, оптимизированных для конкретных сценариев использования.

Источник: