Сегодня 23 февраля 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Нейросеть YandexGPT 2 успешно сдала ЕГЭ по литературе

Разработанная «Яндексом» большая языковая модель YandexGPT 2 справилась с несколькими вариантами ЕГЭ по литературе, получив усреднённую оценку 55 баллов. Это выше минимального порога, необходимого для поступления в вуз (40 баллов) и близко к средней оценке (64 балла), которую получают российские школьники, когда выбирают данный предмет и специально готовятся к экзамену.

 Источник изображений: «Яндекс»

Источник изображений: «Яндекс»

ЕГЭ по литературе содержит несколько испытаний разного рода: вопросы на эрудицию, а также задания для оценки стиля письма и творческих способностей. Для нейросети это непростая задача, но YandexGPT 2 выдержала все испытания: в первой части экзамена она проанализировала произведение и ответила на вопросы о нём, а во второй — написала сочинение на предложенную тему.

В рамках испытания специалисты «Яндекса» получили в Московском центре непрерывного математического образования варианты настоящего ЕГЭ по литературе, которые использовались на тренировочных экзаменах с 2021 по 2023 гг., и удостоверились, что в массиве использованных при обучении YandexGPT 2 данных ответов на эти вопросы нет. Таким образом, нейросеть работала с заданиями наравне с любым школьником, выбирая предложенные варианты и генерируя ответы на открытые вопросы. Проверку проводили официальные эксперты ЕГЭ по литературе.

Разница между сдающими ЕГЭ школьниками и YandexGPT 2 в том, что первые специально готовятся к сдаче, то есть погружаются в специфику предмета, тогда как нейросеть работала скорее экспромтом — схожим образом сдаёт школьные экзамены взрослый человек, опираясь только на накопленные знания. Стандартным способом проверки нейросетей является тест MMLU (Massive Multitask Language Understanding) — он включает вопросы из 57 областей, но не предусматривает оценки ответов на открытые вопросы или написания творческих заданий. Поэтому в «Яндексе» остановились на ЕГЭ по литературе.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Keep Driving — великолепная игра, сотканная из странных идей. Рецензия 2 ч.
Количество слияний и поглощений в российском IT-секторе в 2024 году выросло на треть 3 ч.
В рекордной краже криптовалюты у ByBit обвинили северокорейских хакеров 12 ч.
OpenAI провела зачистку ChatGPT от аккаунтов из Китая и Северной Кореи, подозреваемых во вредоносной деятельности 12 ч.
«Нам просто нужно больше мощностей»: OpenAI постепенно поборет зависимость от Microsoft 12 ч.
Трамповская криптооттепель: Coinbase удалось малой кровью отделаться от иска Комиссии по ценным бумагам США 13 ч.
Apple выпустила первую бету iOS 18.4, в которой появились «приоритетные уведомления» 15 ч.
Новая статья: Kingdom Come: Deliverance II — ролевое вознесение. Рецензия 22-02 00:03
Apple отключила сквозное шифрование в iCloud по требованию властей Великобритании 21-02 23:43
Взрывной платформер Shotgun Cop Man от создателя My Friend Pedro предложит спуститься в ад и арестовать Дьявола — трейлер и демоверсия в Steam 21-02 22:01
Lenovo сообщила о двузначном росте выручки за III финансовый квартал по всем подразделениям — ISG снова в плюсе благодаря ИИ 3 ч.
В облаке Google Cloud появились инстансы A4X на базе суперускорителей NVIDIA GB200 NVL72 3 ч.
STMicroelectronics представила фотонный чип для 1,6-Тбит/с сетей 3 ч.
Несмотря на риск землетрясений, геотермальную энергию ждёт светлое будущее, считают учёные 4 ч.
Размышляющий ИИ DeepSeek R1 встроят в смартфоны Infinix Note 50 7 ч.
Nvidia признала, что не знает, когда сможет решить все проблемы видеокарт GeForce RTX 5000 9 ч.
Huawei захватила больше половины рынка складных смартфонов в Китае — на втором месте Honor 10 ч.
В Asus разогнали GeForce RTX 5090 до 3,5 ГГц и установили несколько рекордов 11 ч.
Норвежцы представили человекоподобного робота для дома и семьи — он мягкий и обтекаемый 12 ч.
На первых смарт-часах OnePlus Watch 3 обнаружена нелепая ошибка, которую невозможно исправить 14 ч.