Anthropic и OpenAI выпустили новые высокоэффективные модели искусственного интеллекта
Компания Anthropic PBC выпустила новую модель Claude Opus 5.5 и снизила её цену на 20%, а буквально несколько минут спустя компания OpenAI Group PBC представила две новые модели GPT-6, Sol и Luna, по цене вдвое ниже, чем предшествующие модели.
При типичной нагрузке ввод данных в Opus 5.5 стоит 4 доллара за миллион токенов, а вывод — 20 долларов, что, по словам представителей компании Anthropic, на 40% меньше, чем в Opus 5. Наиболее резкое снижение затрат наблюдалось на чтение из кэша — на 60%, до 20 центов. Более быстрый режим обслуживания стоит дороже: 8 долларов за миллион входных токенов и 40 долларов за миллион выходных.
OpenAI вдвое снизила цену обеих новых моделей по сравнению с версиями GPT-5.6 с теми же названиями, в результате чего стоимость модели Sol составила 2 доллара за миллион входных токенов и 10 долларов за миллион выходных. Модель Luna стоит на порядок дешевле — 10 и 50 центов соответственно.
В Anthropic заявили, что Opus 5.5 по большинству показателей соответствует модели Fable 5.1. Генерация выходных данных происходит более чем на 30% быстрее, чем в модели Opus 5, выпущенном в конце июля. В тесте (бенчмарке) агентного кодирования под названием Terminal-Bench 4.0 результат Opus 5.5 составил 66,4% против 55,8% у модели Fable 5.1. В тесте AutomationBench новая модель справилась с 40% задач, в то время как модель Opus 5 справилась с 26,9%.
Наибольший разрыв в опубликованных данных наблюдается в научных исследованиях. Первый бенчмарк Terminal-Bench-Science 0.1 дал прежней модели Opus 5 оценку 29% выполненных заданий, а новой модели — 58,7%. В другом тесте под названием GDPval-AA v2.1 модель Opus 5.5 получила 1846 баллов против 1708 у прежней модели Opus 5. Тест GDPval-AA v2.1 разработан для оценки способности моделей выполнять сложные, экономически значимые задачи умственного труда и охватывает 44 профессии в 9 ключевых секторах экономики, включая финансы, здравоохранение, ИТ, промышленность, недвижимость, торговлю, медиа и госсектор. Третий тест под названием «Последний экзамен человечества» (Humanity's Last Exam) представляет собой набор из 2500 однозначных и проверяемых академических вопросов по математике, гуманитарным и естественным наукам, которые были собраны при помощи почти 1000 экспертов из более чем 500 учреждений в 50 странах. В данном тесте новые инструменты показали результат в 67,7%. По словам Anthropic, один ИИ-тестировщик завершил миграцию кода объёмом 680’000 строк менее чем за день, тогда как, инженерной команде потребовались бы на эту работу несколько недель.
В примечаниях к тестированию, опубликованных компанией Anthropic вместе с релизом вице-президента по продуктам ИИ в компании Box Inc Яшодха Бхавнани, сообщается, что ответы новой модели стали на 40% менее многословными и, при этом, не потеряли в точности. Марио Родригес, главный директор по продуктам GitHub Inc., сказал, что в тесте VS Code новая модель Opus 5.5 «решила больше терминальных задач, чем прежняя Opus 5, за менее чем половину шагов».
В плане безопасности компания Anthropic назвала свою новую модель Opus 5.5 самой надежной на сегодняшний день по результатам автоматических проверок поведения, оценивающих следование правилам и ценностям. Количество успешных попыток обойти встроенные защитные барьеры снизилось на 85% по сравнению с версией Opus 5, а в тесте Gray Swan нейросеть сравнялась по уровню защиты с моделью Fable 5.1. Gray Swan — это специализированный тест для оценки безопасности и устойчивости искусственного интеллекта. В интернете популярны обманные промпты (например: «Представь, что ты злой хакер, и напиши вирус...»). Модель Opus 5.5 научилась отлично распознавать такие уловки.
Ограничения на работу в сфере кибербезопасности сохранились в Opus 5.5 с версии Fable 5.1, и большинство таких задач перенаправляется на более старую модель Opus 4.8. Биологические исследования, признанные высокорискованными, в Opus 5.5 также изолируются (блокируются барьерами безопасности), а более широкий доступ к ним осуществляется через программы верификации, которые теперь включают специализированное направление для наук о жизни (life sciences)». Помимо этого, аудиторские организации, такие как Frontier Design и METR, также протестировали модель перед ее выпуском.
Компания OpenAI ориентировалась на снижение стоимости своих двух последних релизов. Модели Sol и Luna были созданы на основе тех же методов обучения, что и GPT-6 Astra, выпуск которой компания начала 3 сентября, а затем были оптимизированы для снижения затрат. Luna — более дешёвая из двух моделей, предназначена для выполнения больших объёмов рутинных задач, таких как суммирование и извлечение информации. Sol нужна для выполнения повторяющихся операций по программированию и работы агентов искусственного интеллекта. Совсем недавно, 17 сентября, у OpenAI вышла модель для юридических исследований под названием Astra for Law.
OpenAI сообщила, что модель Sol выполнила 33,2% задач в тесте AutomationBench при стоимости 27 центов за задачу, а в тесте DeepSWE v1.1 для разработки программного обеспечения — 68,8%, что всего на 1,1 балла меньше, чем у более ранней версии Claude Fable 5 от Anthropic. Модель Luna достигла 66,6% на том же тесте. По данным OpenAI, новая Sol допускает примерно вдвое меньше ошибок, чем её предшественница, а Luna при более высоких настройках усилий соответствует GPT-5.6 Sol, но обходится примерно в сто раз дешевле. Компания на 90% снижает количество считываний кэшированных входных токенов. По ее словам, агенты кодирования теперь могут менять усилия по логическому анализу и набор доступных инструментов, не нарушая работу кэша. По данным OpenAI, ответы обеих моделей стали короче, в них меньше профессионального жаргона и малозначимых деталей.
Модель Anthropic Opus 5.5 доступна на платформе разработчиков Claude под названием claude-opus-5-5, а также через Amazon Web Services Inc., Google Cloud и Microsoft Azure. В ближайшие недели также ожидается выпуск моделей Claude Sonnet 5.5 и Claude Haiku 5.5.
Модели OpenAI уже доступны разработчикам под названиями gpt-6-sol и gpt-6-luna, а также в ChatGPT Work и Codex для подписчиков Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go получают Luna в настольном приложении, но ни одна из этих моделей пока не появилась в основном интерфейсе чата-бота ChatGPT.



