Сегодня 13 мая 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

«Сбер» выложил в открытый доступ русскоязычную ИИ-модель ruGPT-3.5

Инженеры «Сбера» выложили в открытый доступ нейросетевую модель ruGPT-3.5, лежащую в основе сервиса GigaChat, который до сих пор проходит стадию закрытого тестирования. Лицензия MIT позволяет использовать материалы проекта в коммерческих целях.

 Структура датасета ruGPT-3.5. Источник изображения: habr.com

Структура датасета ruGPT-3.5. Источник изображения: habr.com

Важнейшим недостатком открытых больших языковых моделей вроде Meta LlaMA является ограниченная поддержка русского языка — обычно это русский раздел «Википедии» и некоторое количество общедоступных текстов. Это оказывает негативное влияние на понимание моделью языка и качество её ответов. Модель ruGPT-3.5, основанная на архитектуре OpenAI GPT-3, создана в первую очередь для работы в русскоязычной среде, поэтому она более качественно обрабатывает такие запросы.

Обучение модели производилось в два этапа. Первый этап продлился 1,5 месяца — за это время платформа обработала 300 Гбайт данных: книги, энциклопедийные и научные статьи, социальные ресурсы и другие источники. Потребовались ресурсы 512 ускорителей NVIDIA V100. На втором этапе проводилось дообучение на 110 Гбайт данных из датасета The Stack, юридических документов и обновлённых текстов «Википедии» — это заняло три недели и потребовало 200 ускорителей NVIDIA A100.

В результате у ruGPT-3.5 13 млрд параметров при длине контекста 2048 токенов — для сравнения, привели пример разработчики, рассказ А. П. Чехова «Хамелеон» разбивается на 1650 токенов при его длине в 901 слово.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Система оценки совместимости игр для Steam Deck станет актуальной для всех устройств на базе SteamOS 26 мин.
ClickHouse готовится к новому раунду финансирования — оценка капитализации компании выросла до $6 млрд 38 мин.
Google собралась избавиться от кнопки «Мне повезёт!» — её заменит ИИ-поиск 2 ч.
Microsoft отменила релиз предварительной сборки Windows 11 — она получилась чересчур забагованной 2 ч.
Режиссёр The Last of Us Part II натренировал звезду Intergalactic: The Heretic Prophet справляться с травлей в интернете 3 ч.
Apple заклеймила приложения, которые предлагают оплату в обход App Store 4 ч.
«Настоящий шедевр визуального дизайна»: разработчики Heroes of Might & Magic: Olden Era обрадовали фанатов новыми улучшениями игры 4 ч.
Амперсанд сломал голосовые сообщения на iPhone 5 ч.
Мрачный боевик Dragon is Dead скоро сбросит оковы раннего доступа — дата выхода и подробности релизной версии 5 ч.
En+ требует от крупнейшего в России оператора майнинга BitRiver 1,2 млрд рублей — суды арестовали счета и оборудование 6 ч.