Сегодня 22 ноября 2024
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → егэ

Нейросеть YandexGPT 2 успешно сдала ЕГЭ по литературе

Разработанная «Яндексом» большая языковая модель YandexGPT 2 справилась с несколькими вариантами ЕГЭ по литературе, получив усреднённую оценку 55 баллов. Это выше минимального порога, необходимого для поступления в вуз (40 баллов) и близко к средней оценке (64 балла), которую получают российские школьники, когда выбирают данный предмет и специально готовятся к экзамену.

 Источник изображений: «Яндекс»

Источник изображений: «Яндекс»

ЕГЭ по литературе содержит несколько испытаний разного рода: вопросы на эрудицию, а также задания для оценки стиля письма и творческих способностей. Для нейросети это непростая задача, но YandexGPT 2 выдержала все испытания: в первой части экзамена она проанализировала произведение и ответила на вопросы о нём, а во второй — написала сочинение на предложенную тему.

В рамках испытания специалисты «Яндекса» получили в Московском центре непрерывного математического образования варианты настоящего ЕГЭ по литературе, которые использовались на тренировочных экзаменах с 2021 по 2023 гг., и удостоверились, что в массиве использованных при обучении YandexGPT 2 данных ответов на эти вопросы нет. Таким образом, нейросеть работала с заданиями наравне с любым школьником, выбирая предложенные варианты и генерируя ответы на открытые вопросы. Проверку проводили официальные эксперты ЕГЭ по литературе.

Разница между сдающими ЕГЭ школьниками и YandexGPT 2 в том, что первые специально готовятся к сдаче, то есть погружаются в специфику предмета, тогда как нейросеть работала скорее экспромтом — схожим образом сдаёт школьные экзамены взрослый человек, опираясь только на накопленные знания. Стандартным способом проверки нейросетей является тест MMLU (Massive Multitask Language Understanding) — он включает вопросы из 57 областей, но не предусматривает оценки ответов на открытые вопросы или написания творческих заданий. Поэтому в «Яндексе» остановились на ЕГЭ по литературе.


window-new
Soft
Hard
Тренды 🔥
Новая статья: Верные спутники: 20+ полезных Telegram-ботов для путешественников 3 ч.
Итоги Golden Joystick Awards 2024 — Final Fantasy VII Rebirth и Helldivers 2 забрали больше всех наград, а Black Myth: Wukong стала игрой года 5 ч.
В программу сохранения классических игр от GOG вошли S.T.A.L.K.E.R. Shadow of Chernobyl и Call of Pripyat, а Clear Sky — на подходе 6 ч.
Star Wars Outlaws вышла в Steam с крупным обновлением и дополнением про Лэндо Калриссиана 7 ч.
Рекордная скидка и PvP-режим Versus обернулись для Warhammer: Vermintide 2 полумиллионом новых игроков за неделю 9 ч.
Новый трейлер раскрыл дату выхода Mandragora — метроидвании с элементами Dark Souls и нелинейной историей от соавтора Vampire: The Masquerade — Bloodlines 10 ч.
В Японии порекомендовали добавить в завещания свои логины и пароли 11 ч.
Обновления Windows 11 больше не будут перезагружать ПК, но обычных пользователей это не касается 11 ч.
VK похвасталась успехами «VK Видео» на фоне замедления YouTube 13 ч.
GTA наоборот: полицейская песочница The Precinct с «дозой нуара 80-х» не выйдет в 2024 году 15 ч.
Представлен внешний SSD SanDisk Extreme на 8 Тбайт за $800 и скоростной SanDisk Extreme PRO с USB4 5 ч.
Представлен безбуферный SSD WD_Black SN7100 со скоростью до 7250 Мбайт/с и внешний SSD WD_Black C50 для Xbox 5 ч.
Новая статья: Обзор ноутбука ASUS Zenbook S 16 (UM5606W): Ryzen AI в естественной среде 5 ч.
Redmi показала флагманский смартфон K80 Pro и объявила дату его премьеры 7 ч.
Астрономы впервые сфотографировали умирающую звезду за пределами нашей галактики — она выглядит не так, как ожидалось 10 ч.
Представлена технология охлаждения чипов светом — секретная и только по предварительной записи 10 ч.
Японская Hokkaido Electric Power намерена перезапустить ядерный реактор для удовлетворения потребности ЦОД в энергии 10 ч.
Грузовик «Прогресс МС-29» улетел к МКС с новогодними подарками и мандаринами для космонавтов 11 ч.
Meta планирует построить за $5 млрд кампус ЦОД в Луизиане 11 ч.
Arm задаёт новый стандарт для ПК, чтобы навязать конкуренцию x86 12 ч.