Сегодня 19 ноября 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google создала ИИ для проверки фактов в ответах других ИИ

Компания Google разработала ИИ-систему «оценки фактов на основе поисковой выдачи» (Search-Augmented Factuality Evaluator, SAFE), задача которой находить ошибки в ответах сервисов на базе больших языковых моделей (LLM) вроде ChatGPT.

 Источник изображения: pixabay.com

Источник изображения: pixabay.com

LLM используются в разных целях, вплоть до написания научных работ, однако они нередко ошибаются, приводя недостоверные сведения, и даже настаивая на их истинности («галлюцинируя»). Новая разработка команды Google DeepMind вычленяет из вывода нейросети отдельные факты, формирует запрос к поисковой системе и пытается найти подтверждения изложенных сведений.

 Источник изображения: Google Deepmind

Источник изображения: Google DeepMind

Во время тестирования SAFE проверила 16 тысяч ответов нескольких сервисов на базе больших языковых моделей, среди которых Gemini, ChatGPT, Claude и PaLM-2, после чего исследователи сравнили результаты с выводами людей, занимавшихся этим вручную. Выводы SAFE на 72 % совпали с мнениями людей, причём при анализе расхождений в 76 % истина оказывалась на стороне ИИ.

Код SAFE опубликован на GitHub и доступен всем желающим проверить надёжность ответов LLM.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
В Chrome нашли опасную уязвимость, которую уже используют хакеры — вышел экстренный патч 6 ч.
Electronic Arts и Codemasters анонсировали переосмысление симуляторов «Формулы-1» — F1 26 не будет 9 ч.
AMD представит технологию FSR Redstone с реконструкцией лучей и не только 10 декабря 9 ч.
Спасение галактики, истребление пауков и многое другое: Microsoft раскрыла, какие игры пополнят Game Pass в конце ноября и начале декабря 11 ч.
Спустя 7 лет после запуска и через 18 лет после Steam в Epic Games Store появилась возможность дарить игры друзьям 11 ч.
Генпрокуратура признала нежелательной деятельность разработчиков S.T.A.L.K.E.R. 2: Heart of Chornobyl на территории России 13 ч.
Alibaba выпустила ИИ-бота Qwen — будущего конкурента ChatGPT 13 ч.
Евросоюз рассматривает необходимость ограничения возможностей американских облачных гигантов 14 ч.
Roblox скоро начнёт разделять пользователей по возрасту — грядёт обязательная верификация 14 ч.
ИИ-агент в Windows 11 сможет загружать вирусы, предупредила Microsoft 14 ч.
Microsoft и Nvidia готовы вложить до $15 млрд в ИИ-стартап Anthropic 2 ч.
Meta выиграла судебную тяжбу с антимонопольным регулятором США, призывавшим к её разделению 2 ч.
Новая статья: HUAWEI XMAGE 2025: мобильная фотография как полноценное окно в мир искусства 5 ч.
$30 млрд и 1 ГВт: Microsoft, NVIDIA и Anthropic договорились о сотрудничестве 6 ч.
Новая статья: Обзор ноутбука Acer Nitro V 16S AI: минимальный набор геймера, или На что способна мобильная версия GeForce RTX 5050 7 ч.
Xiaomi отчиталась об отличных продажах новых флагманов, миллиарде устройств умного дома и других успехах третьего квартала 7 ч.
Arm добавила Neoverse поддержку NVIDIA NVLink Fusion 7 ч.
Noctua пообещала «совсем скоро» выпустить чёрный кулер NH-D15 G2 chromax.black 7 ч.
Asus выпустила компактную плату Pro WS B850M-ACE SE для рабочих станций на Ryzen 9000 и Epyc 4005 7 ч.
Электролёт Joby Aviation впервые взлетел в небо Дубая — пассажиров начнут возить в 2026 году по тарифу Uber Black 9 ч.