Сегодня 23 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Учёные Apple представили три проекта для ИИ-программирования: обучение, поиск багов и тестирование

Apple опубликовала три статьи, посвящённые исследованиям в области искусственного интеллекта. Учёные компании предложили новые подходы для поиска ошибок в коде, для тестирования созданных ИИ программных решений и для обучения моделей и агентов, способных создавать работающий код.

 Источник изображения: Milad Fakurian / unsplash.com

Источник изображения: Milad Fakurian / unsplash.com

Первое исследование посвящено модели, которую в Apple назвали ADE-QVAET. Она призвана решить проблемы, свойственные традиционным современным моделям ИИ, такие как галлюцинации, выпадение модели из контекста при анализе кодовой базы большого объёма, а также утеря связи с фактической бизнес-логикой применительно к текущему программному решению. ADE-QVAET призвана повысить точность прогнозирования ошибок посредством объединения четырёх методов ИИ: адаптивная дифференциальная эволюция (Adaptive Differential Evolution — ADE), квантовый вариационный автокодировщик (Quantum Variational Autoencoder — QVAE), архитектура трансформера, а также адаптивное шумоподавление и дополнение (Adaptive Noise Reduction and Augmentation — ANRA).

ADE выступает как альтернативный механизм обучения модели, QVAE способствует более глубокому обнаружению закономерностей в данных, трансформер помогает отслеживать связи этих закономерностей, а ANRA обеспечивает очистку и баланс данных, чтобы результаты работы ИИ были согласованными. При этом в отличие от большой языковой эта модель не проводит прямого анализа кода — она оценивает его сложность, размер и структуру и ищет закономерности, которые могут указывать на места, где вероятно возникновение ошибок. Обучив модель на 90 % данных исходного массива, исследователи установили, что точность прогнозов ADE-QVAET составляет от 95 % до 98 %. Это значит, что модель демонстрирует высокую надёжность и высокую эффективность в выявлении действительных ошибок и почти не даёт ложных срабатываний.

Второе исследование, которое провели преимущественно авторы первого, призвано сформировать средства для планирования и создания инструментов тестирования крупных программных проектов. Учёные построили систему Agentic RAG (Retrieval-Augmented Generation) из большой языковой модели и ИИ-агентов, которая самостоятельно планирует, пишет и организовывает тестирование ПО, облегчая работу инженерам по качеству — эти задачи занимают у них от 30 % до 40 % рабочего времени, указывают авторы исследования.

 Источник изображения: Igor Omilaev / unsplash.com

Источник изображения: Igor Omilaev / unsplash.com

Подключение нескольких агентов к ИИ-модели с RAG помогло повысить точность тестирования ПО с 65 %, которые демонстрировала прежняя модель с RAG, работавшая без агентов, до 94,8 % у модели с ИИ-агентами. На 85 % сократилось время тестирования ПО, на те же 85 % повысилась точность средств тестирования, а прогнозируемая экономия средств составила 35 %. Новая система позволила сократить сроки ввода программных решений в эксплуатацию на два месяца. Единственное ограничение предложенной Apple системы Agentic RAG состоит в том, что испытывали её на сложных корпоративных кадровых и бухгалтерских системах, а также средствах SAP.

Третий проект получил название SWE-Gym — его задача не прогнозировать ошибки и не тестировать ПО — это механизм обучения ИИ-агентов. Обучаясь на чтении, редактировании и проверке реально существующего программного кода, эти агенты обретают способность исправлять в нём ошибки. Платформу SWE-Gym построили на основе 2438 реальных задач на языке Python из 11 открытых репозиториев — в каждом из них были исполняемая среда и набор тестов, благодаря которым ИИ-агенты имели возможность практиковаться в написании и отладке кода в реалистичных условиях. Авторы исследования также создали платформу SWE-Gym Lite на базе 230 более простых задач, которая помогает ускорить обучение и снизить затраты на вычислительные ресурсы.

Обученные с помощью средств SWE-Gym агенты правильно решили 72,5 % предложенных задач, то есть платформа помогла повысить качество их работы на 20 процентных пунктов по сравнению с предыдущими методами. В случае с SWE-Gym Lite время обучения сокращается вдвое, если сравнивать с полномасштабной платформой, но обученные на облегчённом варианте агенты предназначаются для работы с более простыми задачами.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Agent 64: Spies Never Die — не время умирать. Рецензия 7 ч.
Всего 1 % игр в Steam собирает 84,5 % выручки, показало исследование 12 ч.
Седьмая утечка геймплея GTA VI показала ограбление заправок и систему повреждения машин 15 ч.
Microsoft возложила вину за проблемы Windows 11 с играми после очередного обновления на RGB-подсветку 17 ч.
Claude улучшил результаты в три раза благодаря оболочке: Nvidia показала новый путь развития ИИ-агентов 17 ч.
Российский рекорд: впервые в истории весь топ-4 The International заняли команды из РФ 17 ч.
Утечки геймплея GTA VI вызвали в Rockstar переполох, но на планы студии не повлияли 17 ч.
Microsoft запустила приложение, которое делает Bing поиском по умолчанию во всех браузерах 18 ч.
DeepSeek представила экспериментальную мультимодальную ИИ-модель — она не уступает Claude Opus 4.8 21 ч.
Магазин на диване переродился: «Яндекс» начал тестировать функции шопинга на смарт-телевизорах 22 ч.
Nvidia поднимет цены на ИИ-ускорители на величину более 15 % со следующего года 23 мин.
Synology представила сетевые хранилища RackStation RS826RP+ и RS826+ формата 1U 11 ч.
Gigabyte представила 1U-серверы серии R165 на базе AMD EPYC Venice 11 ч.
Firefly Aerospace доставит на Луну «ядерную печку» — она будет согревать оборудование холодными лунными ночами 12 ч.
SpaceX в сотый раз запустила ракету Falcon в этом году — на орбиту доставлено ещё 27 спутников Starlink 15 ч.
Скоро полетит: SpaceX протестировала готовность двигателей Starship к историческому полёту с выходом на орбиту 16 ч.
Группировка Starlink разрослась до 11 тыс. спутников, похвастался Илон Маск 16 ч.
Sony Xperia 10 VIII показался на фото за несколько дней до анонса 16 ч.
Google Pixel 11 Pro Fold не выдержал тест на экстремальный изгиб, но хотя бы не взорвался вслед за предшественником 18 ч.
Первый повторный запуск китайской многоразовой ракеты Zhuque-3 состоится в течение полугода 21 ч.