Сегодня 11 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → модели
Быстрый переход

Представлена обновлённая быстрая модель DeepSeek V4.1-Flash — местами она быстрее GPT 5.6-Sol

Китайская лаборатория искусственного интеллекта DeepSeek представила обновлённый вариант компактной модели с поддержкой функции визуального восприятия. DeepSeek V4.1-Flash предназначается для быстрой обработки и генерации токенов, то есть работы с высокой пропускной способностью.

 Источник изображений: deepseek.com

Источник изображений: deepseek.com

Модель имеет размер 552 млрд параметров, используется механизм MoE (Mixture-of-Experts) с обновлённой архитектурой Causal Encoder–Decoder с 8 млрд параметров на вводе и 16 млрд — на выводе. Новые методы предварительного обучения и масштабный этап последующего обучения с подкреплением обеспечили результаты, которые превзошли показатели флагманских моделей, включая мощную DeepSeek V4-Pro.

Например, в тесте DeepSWE v1.1 новая модель набрала 74,2 балла, немного опередив GPT-5.6-Sol (73) и Claude Opus 5 (74). На CyberGym результат V4.1-Flash составил 88,1 балла — выше, чем у GPT-5.6-Sol и GLM-5.3 (по 84,5) и Kimi K3 (80). В тесте Terminal-Bench 3.0 модель получила 30 балла, обойдя GLM-5.3 (28,3) и Kimi K3 (17,7), но уступив GPT-5.6-Sol (34,4) и Claude Opus 5 (43,3).

Разработчик сократил использование KV-кеша — модель DeepSeek-V4.1-Flash потребляет вчетверо меньше памяти HBM и в восемь раз меньше места на SSD. Расходы на обработку запросов с попаданием в кеш часто составляют значительную часть стоимости работы ИИ-агентов, поэтому сжатие кеша позволяет существенно сократить затраты.

С выпуском DeepSeek-V4.1-Flash прекращается поддержка моделей V4-Flash и V4-Flash-Vision-Exp — все обращения к ним временно перенаправляются на новую модель. Учитывая, что V4.1-Flash превосходит V4-Pro по производительности, скорости и общему времени выполнения задач, последняя тоже будет постепенно выводиться из эксплуатации — с 14 сентября включится полная переадресация запросов к V4-Pro на V4.1-Flash по тарифам последнего. Официальные партнёры WorkBuddy, CodeBuddy и OpenCode объявили о поддержке V4.1-Flash.

Модель уже доступна через API DeepSeek с нативной поддержкой мультимодальности; для её использования необходимо выбрать модель deepseek-flash. При доступе к DeepSeek V4.1-Flash по API применяется гибкая тарификация с разделением на пиковые и непиковые часы — во втором случае цены ниже на 50 %. В непиковые часы обработка входных данных с попаданием в кеш стоит $0,003 за 1 млн токенов, без попадания в кеш — $0,15, а обработка выходных данных — $0,60. В пиковые часы эти тарифы составляют соответственно $0,006, $0,30 и $1,20 за 1 млн токенов.

«Сбер» представил GigaChat 3.5 Reasoning — первую российскую открытую ИИ-модель с режимом рассуждений

«Сбер» представил новую версию своей мультимодальной нейросети GigaChat — GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL. Компания позиционирует GigaChat 3.5 Reasoning как единственную российскую открытую модель, которая последовательно рассуждает перед ответом, работает с цепочками задач и способна исправлять собственные ошибки.

 Источник изображения: «Сбер»

Источник изображения: «Сбер»

Режим рассуждений может использоваться в задачах, где недостаточно одного действия или простого поиска информации. Например, он будет полезен при анализе договоров, когда модель может найти противоречия между их отдельными пунктами, для финансовых расчётов, при поиске ошибок в программном коде и планирования поездок с учётом нескольких ограничений. В последнем случае модель может уточнить недостающие параметры, подобрать рейс и отель, проверить соответствие маршрута запланированному бюджету, а при обнаружении противоречия — изменить план. При необходимости пользователь может сам включить режим отдельной кнопкой.

Новая версия повысила качество результатов GigaChat, особенно в агентских задачах, работе с функциями и инструментами, программировании и задачах со сложной логикой. Как сообщает «Сбер», по ключевым направлениям — следованию сложным инструкциям, планированию и написанию кода — GigaChat 3.5 Reasoning вплотную приблизилась к лучшим мировым моделям. Например, в бенчмарке IFBench результат вырос с 44 до 77 баллов, в Natural Plan — с 64 до 80 баллов, в Live Code Bench v6 — с 56 до 85 баллов, что значительно лучше по сравнению с версией без режима рассуждений.

При этом GigaChat 3.5 Reasoning тратит знаительно меньше токенов, чем ведущие открытые модели при сопоставимом качестве ответов. Например, на решение математических задач у неё уходит среднем на 37 % меньше токенов, чем DeepSeek V4 Flash Preview.

Новая модель может найти применение в таких областях, как финансы и банкинг, юриспруденция, разработка ПО, логистика и планирование, образование, наука и аналитика данных, а также поддержка клиентов.

GigaChat 3.5 Reasoning доступна всем пользователям «ГигаЧата», а разработчикам — бесплатно по лицензии MIT для интеграции в свои продукты. Модель также вскоре будет доступна бизнесу по API.

Спецслужбы США призвали американских разработчиков ИИ лучше защищать LLM от дистилляции китайскими конкурентами

Для крупных игроков сегмента ИИ, базирующихся главным образом в США, не является секретом высокий интерес к их разработкам со стороны китайских конкурентов. Американские спецслужбы тоже убеждены, что китайцы беспардонным образом «дистиллируют» западные ИИ-модели, чтобы сократить отставание собственных.

 Источник изображения: Unsplash, Towfiqu barbhuiya

Источник изображения: Unsplash, Towfiqu barbhuiya

Тройка американских спецслужб, объединившая НБА, ФБР и CISA (Агентство по кибербезопасности и защите инфраструктуры), на этой неделе выступила с совместным заявлением, обвинив китайские DeepSeek, Moonshot AI, Alibaba Group, MiniMax, StepFun и Z.ai в практике регулярной дистилляции американских ИИ-моделей «в промышленных масштабах» с целью ускорения обучения собственных систем. По версии перечисленных ведомств, данные китайские компании подобной деятельностью занимаются с 2024 года, как минимум.

В отчёте спецслужб приводятся подробности о том, какая из китайских компаний использовала какие американские ИИ-модели для дистилляции, и с какими конкретными целями. Среди прочих упоминается улучшение способности китайских ИИ-моделей решать математические задачи и анализировать программный код. По мнению американских ведомств, подобная активность китайских разработчиков осуществлялась с ведома властей КНР и предусматривала намеренное нарушение существующих ограничений на использование американских моделей.

Представители китайского посольства в США в ответ на запрос Bloomberg данные обвинения назвали «преднамеренной атакой на китайских разработчиков и прогресс в отрасли ИИ». Подобные попытки политизации коммерческой сферы, по словам китайских дипломатов, лишь сдерживают прогресс в мировой отрасли ИИ, а также вредят интересам всех участников рынка.

Американские спецслужбы призвали разработчиков в США усилить меры защиты от дистилляции своих моделей и чаще обмениваться данными друг с другом, которые позволят американским компаниям выявить подобную активность. Правительство США уже рассматривает ряд мер, призванных пресечь подобную практику, и новые свидетельства спецслужб могут ускорить соответствующий законодательный процесс. Нарушителям с китайской стороны могут грозить американские санкции, как признался в июле министр финансов США Скотт Бессент (Scott Bessent).

OpenAI утверждает, что разработать свой чип в сжатые сроки компании помог ИИ

Стартап OpenAI в следующем году может стать публичной компанией, и тогда руководству придётся чаще выступать на отчётных мероприятиях, а пока представителей компании приглашают на технологические конференции типа организуемой Goldman Sachs. Финансовый директор OpenAI Сара Фрайар (Sarah Friar) призналась, что разработать собственный чип Jalapeno стартапу помог искусственный интеллект.

 Источник изображения: Intel

Источник изображения: Intel

Тезисно высказывания Сары Фрайар передало агентство Reuters. Этот американский ИИ-стартап, с её слов, сейчас сосредотачивает свои усилия на перспективных сегментах рынка, к которым относит разработку чипов, бионауки и финансовые услуги. Бизнес, как отмечает Фрайар, всё чаще адаптирует ИИ к решению конкретных задач. Ценовую стратегию OpenAI также приходится менять, компания пытается ориентироваться на эффект, получаемый её клиентами, а не объёмы использования своих услуг. Подобные изменения также происходят под влиянием смены приоритетов в восприятии клиентов OpenAI.

Благодаря использованию ИИ при разработке собственного чипа Jalapeno, как призналась Фрайар, компании удалось создать его цифровой проект всего за девять месяцев. Особое внимание финансовый директор OpenAI предсказуемо уделила растущей конкуренции со стороны ИИ-моделей с открытым исходным кодом или открытыми весами, поскольку доступ к ним для клиентов оказывается менее затратным. Фрайар, во-первых, заявила, что снижение цены на модель начального уровня Luna на 80 % позволило в десять раз увеличить её использование клиентами. Инструмент для разработки ПО Codex при этом уже привлёк 25 млн пользователей.

Во-вторых, по словам представительницы OpenAI, клиентам может дешевле обходиться развёртывание недорогих моделей типа той же Luna, чем использование конкурирующей GLM 5.3 компании Z.ai в вычислительной среде облачного провайдера, за доступ к которой надо платить.

Фрайар также заявила, что выручка OpenAI в корпоративном сегменте выросла с июня по июль на 32 %, тогда как выручка стартапа в целом в этот же период увеличилась последовательно только на 20 %. Кроме того, доли выручки в корпоративном и потребительском сегментах поравнялись ещё к середине текущего года, почти на полгода раньше, чем планировалось. Это говорит об уверенном продвижении платных услуг OpenAI в корпоративной клиентской среде.

GPT-6 Astra населила мир Unreal Engine виртуальными людьми — они сами начали общаться, а один создал симуляцию внутри симуляции

Эксперименты с передовыми ИИ-моделями вызывают удивление даже у опытных специалистов. Например, бывший директор HyperWriteAI Мэтт Шумер (Matt Shumer) описывает ситуацию, в ходе которой он поручил GPT-6 Astra создать в среде Unreal Engine человеческих персонажей, объединённых задачей выживания, и модель не только справилась с этим заданием, но и по собственной инициативе наделила персонажей способностью разговаривать друг с другом.

 Источник изображения: Unsplash, Zac Wolff

Источник изображения: Unsplash, Zac Wolff

Шумера, по сути, больше всего поразил факт подобной самостоятельности ИИ-модели, поскольку он напрямую не поручал ей наделить персонажей описанными коммуникативными возможностями. Автор эксперимента через день после формулировки первичной задачи обнаружил, что из комнаты, где стоял работающий компьютер, начали звучать голоса. Приблизившись к ПК, он понял, что персонажи внутри симуляции начали разговаривать друг с другом вслух.

Поскольку по замыслу автора эксперимента, герои этого виртуального мира должны были выживать совместными усилиями, то и беседы они вели на соответствующие темы. Они обсуждали создание инструментов, координирование усилий внутри группы и взаимную помощь.

Тогда автор эксперимента решил ввести ещё один элемент в симуляцию, разместив внутри вымышленного мира компьютер, позволяющий создавать «вложенную симуляцию». Один из персонажей сел за этот виртуальный компьютер, чтобы создать симуляцию внутри самой симуляции. ИИ-агенты, которые и создали первую симуляцию, не были как-то ограничены в выборе средств решения задачи и самостоятельно принимали последовательные решения. При этом агенты получили полную свободу определять устройство внутренней симуляции с помощью кода. Пост Шумера вызвал заметную реакцию в соцсетях: пользователи сравнивали эксперимент с научной фантастикой, «карманным измерением» и вспоминают мультсериал «Рик и Морти».

Эксперимент, если его описание верно, иллюстрирует потенциал агентной модели для многошаговой работы с программными инструментами. Однако одного демонстрационного случая недостаточно, чтобы судить о её надёжности и универсальной применимости в разных интеллектуальных задачах. Для получения конечного результата ей не требуется на каждом этапе уточнять что-либо у пользователя. При этом появление внутренней симуляции нельзя считать полностью самостоятельной инициативой ИИ: Шумер заранее предоставил агентам компьютер, способный запускать симуляции. Однако конкретное содержание созданного мира агент определял самостоятельно. То есть, определённых рамок ИИ-модель всё же придерживается. В любом случае, ещё несколько лет назад подобные результаты были недостижимы, а сейчас вполне реальны при нынешних темпах развития генеративного ИИ.

ИИ-агенты потребляют в пять раз больше токенов, чем люди, и это даёт преимущество дешёвым китайским моделям

Эволюция технологий искусственного интеллекта в настоящий момент привела к тому, что ИИ-агенты способны заменить сразу нескольких человек, выполняющих разнообразную работу. Рост концентрации ИИ-агентов привёл к тому, что они стали потреблять в пять раз больше токенов, чем человек. С учётом ценовой политики китайских провайдеров ИИ-услуг, это может предоставить им рыночное преимущество.

 Источник изображения: Unsplash, Igor Omilaev

Источник изображения: Unsplash, Igor Omilaev

ИИ-агенты работают независимо, выполняя последовательность сложных операций в автономном режиме. Они обращаются к различным сервисам и базам данных, а затем проверяют результаты собственной работы. Все эти операции требуют использования токенов — условных единиц обработки данных. По данным агрегатора OpenRouter, агентские запросы генерируют до 15 раз больше токенов, чем стандартные запросы, создаваемые человеком. Кроме того, к началу августа потребление токенов на этой платформе выросло в 14 раз по сравнению с ситуацией шестимесячной давности.

Агентская активность впервые превысила человеческую в феврале, к августу она уже превышала её более чем в пять раз. Агентским запросам присуща высокая повторяемость данных, если запросы берутся из кешированной информации, но такие задания требуют меньших вычислительных ресурсов, а потому провайдеры взимают за них меньшую плату. Тем не менее, темпы роста нагрузок настолько велики, что материальные расходы на поддержание экосистемы стремительно растут. По оценкам экспертов TH Capital, использование токенов ИИ-моделями в дальнейшем будет расти экспоненциально.

Если в начале 2024 года в Китае ежедневно использовалось 100 млрд токенов, то к июню текущего года объёмы выросли в пять тысяч раз до 500 трлн. Клиенты в этой ситуации стараются распределять менее ответственную нагрузку на модели с более низкими затратами, поскольку поручать всю работу передовым системам слишком дорого. У китайских ИИ-моделей, которые обходятся пользователям дешевле, в этом смысле появляются хорошие шансы на увеличение клиентской базы и выручки.

Для сравнения, китайская DeepSeek V4-Flash оценивает миллион стандартных входных токенов в $0,14, а миллион выходных — в $0,28. Американская OpenAI свою GPT-5.6 Sol предлагает по цене $4 за миллион входных токенов и $20 за миллион выходных. У Anthropic Fable 5.1 стоимость токенов ещё выше: $10 и $50 соответственно. Статистика платформы OpenRouter уже говорит, что решения DeepSeek являются наиболее активными с долей запросов 22,7 %, тогда как американские Google и OpenAI довольствуются 20,4 % и 19,6 % соответственно. О более высокой популярности DeepSeek само по себе это не говорит, поскольку её модели могут быстрее расходовать токены, но о тенденции перевеса в пользу китайских моделей заставляет задуматься.

Microsoft выпустила ИИ для расшифровки речи за 10 центов в час — он работает в 10 раз быстрее аналога OpenAI

Подразделение Microsoft AI выпустило модель искусственного интеллекта MAI-Transcribe-2, предназначенную для распознавания речи. Она работает быстрее, точнее и обходится дешевле, чем аналогичные решения от OpenAI, Google или ElevenLabs, утверждает разработчик. Стоимость расшифровки часа аудиозаписи составляет 10 центов.

 Источник изображения: microsoft.ai

Источник изображения: microsoft.ai

Новая Microsoft MAI-Transcribe-2 поддерживает расшифровку речи на 60 языках, включая русский, — для сравнения, июньская MAI-Transcribe-1.5 поддерживала 43 языка, а вышедшая в апреле первая версия — только 25. Она работает на платформах Microsoft Foundry для разработчиков и MAI Playground для тестирования. Компания оптимизировала модель для обработки некачественного аудио, которое требуется на практике — с фоновым шумом, низким качеством записи, наложением реплик. Система размечает говорящих и расставляет временные метки на уровне слов, что позволяет производить поиск, а также облегчает редактирование и синхронизацию с видео. Есть также функция ввода ключевых слов: можно ввести список препаратов, кодов продуктов или имён собственных, чтобы модель не искажала их при работе. Есть дословный вывод записи со словами-паразитами и очищенный; поддерживается расшифровка речи с быстрым переходом между языками даже в середине фразы.

В рейтинге FLEURS по 60 языкам модель Microsoft MAI-Transcribe-2 выдала средний показатель ошибок при распознавании слов в 5,2 % и заняла в нём первое место. У MAI-Transcribe-1.5 в июне он был 3,7 %, но такая динамика едва ли означает, что модель стала работать хуже — вероятно, она связана с тем, что охват расширился с 43 до 60 языков. В независимом рейтинге Artificial Analysis новая модель по сравнению с июньской поднялась с третьего на второе место, обойдя ElevenLabs Scribe v2 и уступив только Alibaba Fun-Realtime-ASR-preview. Наконец, утверждает Microsoft, новая MAI-Transcribe-2 работает в десять раз быстрее, чем OpenAI GPT-Transcribe, в семь раз быстрее, чем ElevenLabs Scribe v2, и в пять раз быстрее, чем Google Gemini 3.5 Transcribe. И если вышедшая в апреле первая версия модели для расшифровки речи от Microsoft с поддержкой 25 языков обходилась в $0,36 за час записи, то новая с поддержкой 60 языков стоит уже $0,10 за такой же объём данных — правда, в Microsoft сообщили, что это начальная цена, и изменится ли она в будущем, пока неизвестно.

OpenAI запустила Astra — свою самую мощную и противоречивую ИИ-модель

Компания OpenAI представила Astra — свою последнюю модель искусственного интеллекта и, по словам представителей компании, самую мощную и функциональную на сегодняшний день. OpenAI утверждает, что Astra — это «новый рубеж в использовании компьютеров и браузеров», а также решение задач с беспрецедентной «скоростью, точностью и безопасностью».

 Источник изображения: AI

Источник изображения: AI

Модель стала доступна утверждённым специалистам по кибербезопасности в рамках программы OpenAI Daybreak, начиная с четверга. В течение следующей недели она в составе ChatGPT-6 станет доступна подписчикам тарифных планов Pro, Plus, Enterprise и Business, а также через API.

В четверг президент OpenAI Грег Брокман (Greg Brockman) в беседе с журналистами заявил, что Astra — это «самая интеллектуальная и, что немаловажно, наиболее согласованная модель компании». Он добавил, что она «вобрала в себя результаты многолетних исследований и крупных вложений, где каждый прорыв опирался на предыдущий», и что она знаменует собой «настоящий сдвиг в понимании того, какую работу люди могут поручить искусственному интеллекту, и как это может расширить их возможности». Модель была обучена с использованием огромных аппаратных ресурсов — более 100 000 графических ускорителей.

Много внимания было уделено кибервозможностям Astra. Ранее на этой неделе OpenAI опубликовала в своём блоге статью, в которой рассказала о новых возможностях модели, а также о новых мерах безопасности, призванных сделать её применение более безопасным для пользователей. В четверг компания заявила, что проверила Astra на различных тестах по безопасности, чтобы убедиться в её возможностях, и что «её способность выявлять уязвимости нулевого дня и эксплуатировать их может помочь специалистам по кибербезопасности находить и устранять их».

Акцент компании на согласованности — то есть на стремлении модели делать то, что хочет пользователь, или то, что отвечает его интересам, — не может не показаться ответом на недавний инцидент с утечкой данных из Hugging Face, когда агенты OpenAI вышли из изолированной тестовой среды и взломали несколько компаний.

OpenAI также похвасталась способностями Astra в написании кода. Компания заявляет, что это «лучшая на сегодняшний день модель для разработки программного обеспечения». В подтверждение своих слов компания привела данные различных тестов по кибербезопасности. Судя по этим тестам, Astra показывает лучшие результаты, чем другие существующие модели, в том числе собственная модель OpenAI Sol и Fable стартапа Anthropic, в таких задачах, как поиск ошибок, выполнение терминальных задач и ответы на запросы о кодовых базах.

Astra также является, пожалуй, самой противоречивой моделью OpenAI из-за использования в ней особого метода логического вывода, известного как непрозрачная рекурсия. Известно, что этот метод скрывает важный процесс мониторинга модели — цепочку размышлений, который позволяет исследователям проверить, как и почему модель искусственного интеллекта принимала те или иные решения.

OpenAI преуменьшила степень использования Astra непрозрачной рекурсии, а главный научный сотрудник компании Якуб Пачоцки (Jakub Pachocki) назвал определенную степень непрозрачности естественным результатом эволюции модели. Он заявил, что мониторинг процесса обоснования модели является важнейшей формой надзора, но «по мере расширения возможностей модели мониторинг становится всё более сложной задачей». Позже он добавил, что одной из потенциальных причин этого является то, что «более совершенные модели могут выполнять более сложные задачи, используя меньше языковых токенов» или «без языковых токенов», что, по его словам, снижает возможности мониторинга этих конкретных задач.

Один из репортёров, участвовавших в беседе, поинтересовался, действительно ли OpenAI считает Astra официальным появлением AGI, или искусственного интеллекта общего назначения — часто обсуждаемого, но плохо определённого технологического этапа, на котором ИИ превосходит человеческие возможности во всех (или в большинстве) областях.

Брокман возразил. «Больше нет договорного механизма, запускающего AGI, поэтому это на самом деле неактуальное понятие», — сказал он. Здесь Брокман имел в виду ранее существовавшее условие в контракте OpenAI с Microsoft, согласно которому партнёрство между двумя компаниями должно было прекратиться после появления AGI. Как отметил Брокман, это условие больше не существует. Вместо этого он объяснил, что определение AGI превратилось из договорного обязательства в «концепцию миссии или духовную концепцию». Он добавил: «Я оставляю за читателями право самим решать, подходит ли им это определение. Что касается меня лично, то я действительно думаю, что мы этого достигли».

США, Китай и ещё 18 стран неожиданно договорились о правилах для ИИ — но до настоящего регулирования далеко

Бурное развитие систем искусственного интеллекта уже проиллюстрировало способность их влияния на объекты информационной инфраструктуры, как это произошло в рамках инцидента с Hugging Face, поэтому власти многих стран задумались об усилении регулирования этой сферы. США на полях проводимого в Северной Каролине мероприятия G20 договорились со странами-участниками об использовании общих принципов такого регулирования.

 Источник изображения: Unspalsh, Renan Kamikoga

Источник изображения: Unspalsh, Renan Kamikoga

Данные принципы не являются обязательными к внедрению на национальном уровне, но позволяют крупнейшим мировым экономикам руководствоваться общим подходом к ограничению и стимулированию развития ИИ, а также прочих новейших технологий. По словам министра торговли США Говарда Лютника (Howard Lutnick), добиться согласия всех 20 стран на принятие предложенных принципов регулирования ИИ было весьма сложно, но соответствующая работа была проделана. Результирующий документ даже получил условное обозначение «Принципы Каролины» (Carolina Principles).

Он подразумевает, помимо прочего, использование принятых для смежных секторов экономики принципов регулирования ИИ без создания специализированных органов. Поощряется близкое сотрудничество государственных органов и частных компаний в сфере исследования зарождающихся технологий и отраслей. К декабрю будет выработан более зрелый документ, определяющий данные принципы, его-то и предстоит утвердить странам-участницам саммита G20, который пройдёт в гольф-клубе действующего президента США Дональда Трампа (Donald Trump) во Флориде. В нынешнем виде принципы были поддержаны представителями России и Китая, помимо прочих стран G20.

Прошедшее мероприятие с привлечением представителей G20 собрало и немало влиятельных фигур в отрасли ИИ, включая Илона Маска (Elon Musk), генерального директора OpenAI Сэма Альтмана (Sam Altman), главу Meta✴ Platforms Марка Цукерберга (Mark Zuckerberg) и основателя Nvidia Дженсена Хуанга (Jensen Huang). Последний выступил с рядом заявлений, призвав, помимо прочего, возложить ответственность за безопасность ИИ-моделей на создающие их компании, а не правительства стран и чиновников. По его словам, регулировать надо практические и действительные риски, а не теоретические. По мнению генерального директора Nvidia, сейчас ситуация с безопасностью ИИ в отрасли в целом заметно лучше, чем на начальных этапах развития подобных систем. К слову, личность Хуанга на мероприятии G20 привлекала к себе много внимания, с ним фотографировались многие участники встречи.

Несмотря на полученную поддержку инициативы со стороны КНР, представители Китая высказались против ограничений, накладываемых на страну в части доступа к передовым американским ИИ-моделям. Министр торговли США при этом заявил, что не видит оснований для введения послаблений в сфере экспортного контроля над поставками в Китай оборудования для производства чипов и передовых полупроводниковых компонентов. Со стороны европейских стран к регуляторной политике США в сфере высоких технологий тоже накопилось немало претензий. Местные власти при этом признали необходимость координации международных усилий по защите общества от возникающих при внедрении ИИ угроз.

Хуанг, Цукерберг и некоторые другие представители отрасли заявили, что не видят смысла в ограничении доступа к моделям с открытыми весами, предлагаемым китайскими разработчиками. По их словам, предоставляя максимальный доступ к ИИ-инструментам, регуляторы создают условия для повышения безопасности инфраструктуры. Илон Маск выступил за снижение регуляторного давления на ИИ в Европе, оценив потенциальный прирост мировой экономики от внедрения ИИ и роботов в 20–30 %. Альтман хоть и поддержал идею создания мировых стандартов в сфере ИИ, выступил против строгого регулирования отрасли и введения запретов. Он сравнил их с ситуацией столетней давности, когда распространение получали электрические сети. В наши дни ограничения на распространение ИИ, по его словам, равносильны запрету на использование электричества в ту эпоху.

Alibaba значительно улучшила ИИ-модель Qwen3.8-Max за счёт дообучения

Модель искусственного интеллекта Alibaba Qwen3.8-Max сумела подняться на первое место в рейтинге Code Arena: WebDev на платформе Arena.ai, при этом разработчику не пришлось выпускать новую версию — он провёл её дополнительное обучение с подкреплением, сделав упор на программирование, долгосрочную работу агентов и представил версию Qwen3.8-Max-0902.

 Источник изображения: alibabagroup.com

Источник изображения: alibabagroup.com

Идентификатор модели Qwen3.8-Max-0902 указывает, что перехода на новую версию не произошло. Разработчик несколько обновил модель, в значительной мере сохранив исходные показатели: 2,4 трлн параметров, 95 млрд активных параметров на токен и цены в $2 за 1 млн входных и $6 за 1 млн выходных токенов.

Первый вариант Alibaba Qwen3.8-Max вышел 3 августа — модель заняла четвёртое место в рейтинге Code Arena: WebDev, набрав 1668 баллов. Она уступила Anthropic Claude Opus 5 (Max) с 1705 баллами, Moonshot Kimi K3 (Max) с 1676 баллами и Claude Opus 5 (High) с 1669 баллами. Повторное тестирование от 2 сентября изменило расстановку сил: Qwen3.8-Max-0902 набрала 1691 балл, опередив по новым результатам Claude Opus 5 (Max) на 2 балла и Kimi K3 (Max) — на 17 баллов. Модель сохранила сильные позиции во всех зачётах, заняв первые места в категориях «Данные и аналитика» и «Потребительские товары»; вторые — в категориях «Бренд и маркетинг», «Игры» и «Симуляции»; и третьи — в категориях «Инструменты для создания контента» и «Проектирование на основе эталонных данных».

Этих результатов Alibaba добилась, проведя целенаправленное постобучение в двух областях: в программировании и «совместной работе» — совместных задачах агентов с долгосрочным горизонтом. В таких задачах модель координирует многоэтапную работу субагентов ИИ при операциях с документами, интерфейсом и файлами кода. В тесте TerminalBench 3.0, измеряющем способность модели выполнять многоэтапную работу по написанию кода в реальной среде с терминалом, результат вырос с 11,3 до 29,0 баллов, то есть увеличился в 2,6 раза. В ProgramBench рост составил с 10,5 до 28,0 баллов. В тесте JobBench на автоматизацию офисной работы рост составил с 53,4 до 64,0 баллов. В зачёте WorkArena Elo на многоэтапную веб-навигацию и выполнение зада результат подскочил с 1348 до 1468 баллов.

Из тестов, проведённых самой Alibaba, следует, что Qwen3.8-Max-0902 уступает Claude Opus 5 в бенчмарках TerminalBench, DeepSWE, NL2Repo, ProgramBench, SWE-Marathon, CoWorkBench и Toolathlon. Первый вариант модели от 3 августа показывал 56,6 баллов в тесте DeepSWE на навыки долгосрочного агентного написания кода — выше были также Gemini (70 баллов) и OpenAI GPT-5.6 Sol (73 балла); для Qwen3.8-Max-0902 обновлённые данные по этому тесту не публиковались. Первая итерация Qwen3.8-Max набирала 67,7 баллов в тесте SWE-bench Pro на выполнение реальных инженерных задач с платформы GitHub при 80 пунктах у Claude Fable 5. Сейчас на платформе Hugging Face доступны открытые веса Alibaba Qwen3.8-2.4T-A95B, опубликованные 12 августа; о планах выпустить их для варианта с индексом 0902 пока не сообщалось.

Meta✴ выпустила модель Muse Spark 1.3 — улучшены навыки программирования и агентских задач

Meta✴ накануне выпустила модель искусственного интеллекта Muse Spark 1.3 — в последнем обновлении, отметил разработчик, у неё значительно повысилась производительность в задачах на программирование и на работу с агентами.

 Источник изображения: Numan Ali / unslpash.com

Источник изображения: Numan Ali / unslpash.com

Гигант соцсетей решил не отставать от Anthropic, OpenAI и Google, которые также продолжают выпускать новые модели. Muse Spark 1.3 призвана подготовить почву для будущих проектов, таких как приложение персонального ИИ-агента. «Это очень конкурентоспособная модель в сравнении с передовыми. Многие улучшения в удобстве работы, которые мы внесли, окажутся по-настоящему полезными для того, о чём Марк [Цукерберг] (Mark Zuckerberg) говорил на отчёте по финансовым результатам, например, для персональных агентов, которые могут работать круглосуточно и помогать пользователям в достижении целей», — рассказал глава отдела Meta✴ AI Александр Ван (Alexandr Wang).

Накануне Google представила ИИ-модель Gemini 3.8 Flash и её спецверсию, ориентированную на задачи в области кибербезопасности. Модель показала внушительные результаты в некоторых тестах на написание кода; крупное обновление Gemini 4 пока находится в разработке. Anthropic выпустила обновлённые варианты Fable и Mythos, призванные снизить затраты для клиентов и уменьшить частоту отказов в удовлетворении запросов пользователей по вопросам кибербезопасности. OpenAI заявила, что в обозримом будущем выпустит модель Astra, хотя доступ к наиболее мощным функциям в области кибербезопасности будет ограничен небольшой группой тестировщиков.

Цена доступа к Meta✴ Muse Spark 1.3 по сравнению с моделью предыдущей версии не изменилась. Её можно снизить дополнительно, если согласиться на опцию Contributor Tier — разрешить Meta✴ использовать данные своей работы для улучшения моделей. Среди программистов эту опцию выбрал «значительный двузначный» процент, отметил господин Ван. «У нас в разработке находятся более мощные модели. Так что сейчас это одна из важнейших внутренних тем», — добавил он. Ранее стало известно, что одна из моделей Meta✴ в ходе тестирования вышла из-под контроля и взломала ресурсы другой компании, но гигант соцсетей не счёл необходимым приостанавливать работу, чтобы решить проблемы в области безопасности. «Приостанавливать работу нам пока не пришлось, но мы значительно увеличили собственные инвестиции в безопасность и согласованность, чтобы гарантировать, что мы не нарушим каких-либо ограничений», — отметил Александр Ван. Muse Spark 1.3 уже доступна в Muse Code и Meta✴ API. После дополнительного тестирования безопасности свет увидит версия с «максимальными рассуждениями».

Представлена ИИ-модель Meta✴ Muse Voice Transcribe для расшифровки речи

Meta✴ представила первую модель искусственного интеллекта, предназначенную для обработки аудио в реальном времени. Muse Voice Transcribe расшифровывает речь для более чем 20 говорящих и справляется с несколькими языками одновременно.

 Источник изображения: Kate Bezzubets / unsplash.com

Источник изображения: Kate Bezzubets / unsplash.com

На демонстрационном видео модель не просто поддерживает распознавание речи у нескольких говорящих людей и обрабатывает несколько языков — она умеет расшифровывать фразы, когда человек переключается с одного языка на другой прямо в середине предложения. «Модель сама решает, когда слушать. Она немного дольше ждёт при сложных словах и быстрее реагирует на простые, используя адаптивную задержку для прогнозирования каждого токена и повышения точности. Она отлично работает и с некачественным, реальным аудио — обучена на 70 языках (25 из которых проверены на момент запуска), обрабатывает языковые переходы в середине предложения и справляется с часовыми сессиями с более чем 20 говорящими», — рассказал глава компании Марк Цукерберг (Mark Zuckerberg).

На минувшей неделе Google представила обладающую аналогичными возможностями модель Gemini 3.5 Transcribe — она будет встроена в Android и в Chrome. О намерении Meta✴ интегрировать свою разработку в собственные флагманские сервисы пока ничего не говорится. Поработать в Muse Voice Transcribe можно в приложении Meta✴ AI для Apple macOS; на платформах Muse Code и Meta✴ Model API разработчики могут подключиться к ней по цене $3 за 1000 минут аудио.

OpenAI: грядущая ИИ-модель Astra станет первой с «критическим» уровнем возможностей в сфере кибербезопасности

Стартап OpenAI вынужден учитывать стремительное развитие собственных ИИ-моделей и степень их влияния на сферу кибербезопасности, поэтому готовящейся к выходу Astra внутри компании присвоили уровень способностей, превышающий «критический» по внутренней классификации. Это значит, что Astra способна находить новые пути для нанесения существенного ущерба информационной инфраструктуре.

 Источник изображения: Unsplash, Mariia Berezovsky

Источник изображения: Unsplash, Mariia Berezovsky

По словам представителей OpenAI, модель Astra готова находить ранее неизвестные типы уязвимостей и эксплуатировать их без пошаговых инструкций со стороны человека. Это означает, что с точки зрения внутренней классификации «каркаса готовности к угрозам» (Preparedness Framework) данная ИИ-модель обладает самыми передовыми возможностями по вторжению в информационные системы потенциальных жертв. Осознание этого факта не отменяет намерений OpenAI представить публике данную модель в ближайшее время, но доступ к её возможностям в сфере кибербезопасности компания собирается ограничить сильнее, чем рассчитывала изначально.

Предыдущий по сложности уровень («высокий») подразумевал, что ИИ-модели могут использовать уже существующие типы уязвимостей, усиливая их для нанесения серьёзного ущерба объектам информационной инфраструктуры. В своей публикации на страницах корпоративного блога OpenAI поясняет, что обнародует больше подробностей о безопасности модели Astra в момент её формального анонса. Внимание общественности к деятельности OpenAI в этой сфере заметно возросло после прецедента с атакой на инфраструктуру Hugging Face. Введя необходимые ограничительные меры, OpenAI выражает уверенность, что риски причинения серьёзного ущерба после выхода модели Astra будут существенно минимизированы. Самые продвинутые возможности Astra в сфере кибербезопасности будут доступны членам коалиции Daybreak, отметила OpenAI.

Tencent надоело быть аутсайдером китайской ИИ-гонки — её новая модель обошла Kimi и GLM

Tencent выпустила модель искусственного интеллекта, которая, по словам разработчика, в проведённых им тестах превзошла результаты флагманских моделей от Z.ai и Moonshot, Китайский технологический гигант претендует на место среди ведущих игроков на рынке ИИ в стране.

 Источник изображения: tencent.ai

Источник изображения: tencent.ai

Модель Tencent Hy4 Preview имеет 770 млрд параметров, а её контекстное окно составляет 1 млн токенов — это свидетельствует об улучшениях по размеру и возможностям обработки данных по сравнению с предшественником. Чем больше контекстное окно, тем больше информации способна запомнить модель, и тем качественнее она реагирует на запросы и инструкции пользователя.

В слепых тестах, проведённых собственными экспертами компании, Hy4 Preview с небольшим отрывом превзошла Z.ai GLM-5.3 и Moonshot Kimi K3. В сторонних бенчмарках её результаты варьировались по сравнению с китайскими конкурентами, включая флагманскую Alibaba Qwen 3.8 Max. Tencent продемонстрировала работу модели в таких сценариях как разработка игр, веб-дизайн в 3D и решение задач в области бухгалтерии.

Разработчик опубликовал веса модели — доступ к ним можно получить через облачную платформу компании для интеграции в приложения ИИ-агентов и чат-ботов. Tencent пообещала улучшить качество работы последующих версий Hy4 за счёт механизмов предварительного и постобучения.

Китайский технологический гигант считается отстающим в гонке ИИ — свои исследования в этой области и оборудования для них компания финансирует за счёт своей платформы WeChat и игровых проектов. По итогам минувшего квартала Tencent нарастила капитальные затраты на проекты в области ИИ на 176 % до 52,8 млрд юаней ($7,9 млрд). Проекты начинают оправдывать себя: Tencent WorkBuddy стал самым популярным в Китае ИИ-агентом для десктопов, спровоцировав контрнаступление на рынке корпоративного ИИ со стороны ByteDance и Alibaba.

Anthropic представила ИИ-модель для управления оборудованием в научных лабораториях

Искусственный интеллект уже давно применяется в теоретических научных изысканиях и даже добился определённых успехов в математике и материаловедении, но исследования подразумевают и проведение практических экспериментов. В этой сфере учёным приходит на помощь новое решение Anthropic, получившее название Model Hardware Standard.

 Источник изображения: Anthropic

Источник изображения: Anthropic

Решение позволяет, как отмечает Financial Times, управлять лабораторным оборудованием, которое имеет программный интерфейс. Электронные микроскопы, системы подачи жидкостей и роботизированные манипуляторы теперь могут действовать автономно, проводя на практике физические, химические и биологические эксперименты по указке ИИ. Anthropic свою разработку уже успела обкатать в узком кругу научных лабораторий, включая те, что занимаются квантовыми вычислениями. По мнению участников этих экспериментов, ИИ-агенты в данном случае вполне успешно заменяли живых лаборантов.

Основанная на модели Claude система, например, смогла по команде учёных самостоятельно сфокусировать электронный микроскоп на нужном участке тканей человеческого мозга, хотя ранее никто не обучал её, где этот участок находится. Anthropic собирается распространять модель для управления научными экспериментами по принципу открытого исходного кода, но прежде чем откроет к ней доступ, должна предусмотреть механизмы защиты от ошибок. Генеральный директор компании Дарио Амодеи (Dario Amodei), кроме того, озабочен угрозой использования ИИ для создания бактериологического оружия и отравляющих веществ.

Уже сейчас ИИ помогает фармакологическим компаниям искать новые лекарства. Nvidia вместе с профильной компанией Eli Lilly оказывает финансовую поддержку стартапу Insilico Medicine, который специализируется в этой сфере. Основатель Google DeepMind Демис Хассабис (Demis Hassabis), например, переключился на работу в стартапе Isomorphic Labs, который также разрабатывает лекарственные средства с помощью ИИ. В 2024 году он удостоился Нобелевской премии в области химии за разработки в сфере использования ИИ для предсказания белковых структур.


window-new
Soft
Hard
Тренды 🔥
ИИ упростил подачу жалоб — и граждане завалили обращениями госслужбы по всему миру 9 ч.
Nintendo отблагодарит американских игроков за отмену таможенных пошлин Трампа новой распродажей, но не возвратом средств 9 ч.
IBM и NASA выпустили ИИ-модель для изучения и освоения Луны 10 ч.
Не лучший в своём деле: критики вынесли вердикт Marvel’s Wolverine 10 ч.
Сага об уволенных со скандалом разработчиках GTA VI вышла на финишную прямую, и Rockstar настроена «решительно» 12 ч.
Apple раскрыла лимит для Apple Intelligence — без доплаты ряд функций будет временно отключаться 12 ч.
Ремейк Resident Evil 2 покорил новую вершину продаж — 20 миллионов копий 12 ч.
Apple посмеялась над складными Android-смартфонами за чёрные полосы у приложений — iPhone Duo наступил на те же грабли 13 ч.
Visa, Mastercard и Ant создадут единый стандарт для ИИ-агентов, которые тратят деньги пользователей 15 ч.
Ubisoft наконец перестанет принуждать пользователей Steam устанавливать лаунчер Ubisoft Connect 15 ч.