Сегодня 01 июня 2024
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google создала ИИ для проверки фактов в ответах других ИИ

Компания Google разработала ИИ-систему «оценки фактов на основе поисковой выдачи» (Search-Augmented Factuality Evaluator, SAFE), задача которой находить ошибки в ответах сервисов на базе больших языковых моделей (LLM) вроде ChatGPT.

 Источник изображения: pixabay.com

Источник изображения: pixabay.com

LLM используются в разных целях, вплоть до написания научных работ, однако они нередко ошибаются, приводя недостоверные сведения, и даже настаивая на их истинности («галлюцинируя»). Новая разработка команды Google DeepMind вычленяет из вывода нейросети отдельные факты, формирует запрос к поисковой системе и пытается найти подтверждения изложенных сведений.

 Источник изображения: Google Deepmind

Источник изображения: Google DeepMind

Во время тестирования SAFE проверила 16 тысяч ответов нескольких сервисов на базе больших языковых моделей, среди которых Gemini, ChatGPT, Claude и PaLM-2, после чего исследователи сравнили результаты с выводами людей, занимавшихся этим вручную. Выводы SAFE на 72 % совпали с мнениями людей, причём при анализе расхождений в 76 % истина оказывалась на стороне ИИ.

Код SAFE опубликован на GitHub и доступен всем желающим проверить надёжность ответов LLM.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Вечерний 3DNews
Каждый будний вечер мы рассылаем сводку новостей без белиберды и рекламы. Две минуты на чтение — и вы в курсе главных событий.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Владелец Ticketmaster подтвердил утечку данных 560 млн пользователей спустя 11 дней 31 мин.
В Telegram добавили сообщения с анимированными эффектами, глобальные хештеги и другие нововведения 2 ч.
Anthropic позволит создавать персональных помощников на базе ИИ-чат-бота Claude 3 ч.
ElevenLabs запустила ИИ-генератор звуковых эффектов по текстовому описанию 3 ч.
Новая статья: Songs of Conquest — песнь величия. Рецензия 15 ч.
В ранний доступ Steam ворвался олдскульный шутер Selaco на движке классических Doom — с перестрелками и умными врагами в духе F.E.A.R. 17 ч.
Warhorse официально подтвердила перевод на русский язык в Kingdom Come: Deliverance 2 18 ч.
Perplexity AI превратит поисковую выдачу в веб-страницу, которой удобно делиться с другими 19 ч.
Google добавила редактирование RCS-сообщений и другие полезные функции в Android 19 ч.
Эндгейм подкрался незаметно: авторы перспективного «дьяблоида» Wolcen: Lords of Mayhem решили забросить разработку всего через четыре года после релиза 19 ч.
Вулканическую юпитерианскую луну Ио впервые сняли с Земли в лучшем разрешении, чем с космических аппаратов 34 мин.
Новые спутники Starlink могут уничтожить радиоастрономию на Земле, предупреждают учёные 3 ч.
Корейский профсоюз Samsung объявил забастовку, но на производство и поставки памяти это не повлияет 3 ч.
Последний «дружественный» поставщик VSAT-оборудования Gilat Satellite Networks приостановил работу в РФ 3 ч.
Минцифры предлагает выдавать льготные кредиты для строительства ЦОД 4 ч.
Госархив РФ построит в Калужской области дата-центр за 1 млрд руб., оснастив его российскими серверами и СХД Depo 4 ч.
В метеорите с Марса учёные разглядели образ древней Земли 4 ч.
Blackview выпустила защищённый смартфон Oscal Pilot 2 с двумя экранами и мини-ПК MP100 с мощной начинкой 5 ч.
Робот-пылесос Dreame D9 Max и вертикальный беспроводной пылесос R20 обеспечат качественную и быструю уборку 6 ч.
Samsung будет выпускать для AMD передовые 3-нм чипы с GAA-транзисторами 6 ч.