Оригинал материала: https://3dnews.ru/1147364

Ставим локальный ИИ на картофелину, или «ChatGPT есть у нас дома!»

Граница между большими и малыми языковыми моделями (БЯМ/МЯМ) достаточно условна, поскольку проводится по количеству характеризующих ту или иную нейросеть рабочих параметров (грубо говоря, весов на входах её перцептронов): меньше 7−10 млрд — МЯМ, больше — БЯМ. Это, конечно, чисто формальная оценка: разнообразие малых моделей крайне велико и не сводится к какому бы то ни было количественному показателю. Есть специализированные МЯМ для решения узких задач, натренированные на тщательно подобранных наборах данных с нуля; есть дистиллированные версии БЯМ, дополнительно облегчённые за счёт квантизации весов, выборочного обнуления (pruning) значительной доли не слишком существенных для работы модели параметров и т. д. Следует учитывать и временной фактор: одна из первых в мире бесспорно больших ИИ-моделей на основе трансформеров для коммуникации с оператором на естественном языке, BERT, содержала (и содержит до сих пор, — её веса в открытом доступе) всего-то 110 млн параметров; смехотворно мало по нынешним меркам. Гораздо полезнее с практической точки зрения провести границу иначе, всякий раз выясняя, возможно ли ту или иную модель запустить на локальном «железе» — смартфоне, ПК, даже сравнительно доступном рядовому ИИ-энтузиасту сервере (оснащённом парой добытых по случаю на распродаже старушек Nvidia A100, например, или четвёркой GeForce RTX 3080 с кустарно нарощенной до 20 Гбайт видеопамятью каждая) — или же нет.

 Моддеры по всему миру: покупают СЖО с мультирежимной подсветкой; прорезают окно в боковой стенке корпуса и украшают его витражным стеклом; в крайнем случае погружают все компоненты ПК в абсолютированный изопропанол, чтобы улучшить теплоотвод ради экстремального разгона. Моддеры из КНР: распаивают на видавших виды RTX 3080 дополнительные 10 Гбайт GDDR6X и выкладывают в онлайн-магазин (источник: VideoCardz)

Моддеры по всему миру: покупают СЖО с мультирежимной подсветкой; прорезают окно в боковой стенке корпуса и украшают его витражным стеклом; в крайнем случае погружают все компоненты ПК в абсолютированный изопропанол, чтобы улучшить теплоотвод ради экстремального разгона. Моддеры из КНР: распаивают на видавших виды RTX 3080 дополнительные 10 Гбайт GDDR6X и выкладывают в онлайн-магазин (источник: VideoCardz)

Мы некоторое время назад рассматривали в рубрике «Мастерская» как раз специализированные на создании статичных изображений модели, условно относимые к «малым» именно по той причине, что они помещаются в память (пусть не целиком в одну только VRAM, а с частичной выгрузкой в общесистемную RAM) далеко не самого современного игрового ПК. Взять для примера чрезвычайно популярную сегодня у энтузиастов модель Krea 2: у её основного модуля — 12,9 млрд параметров, а в качестве перекодировщика текстовой подсказки в токены она полагается на предварительно исполняемую Qwen3-VL 4B с 4 млрд параметров. Получается, на локальном компьютере у любителя ИИ-картинок, когда тот запускает ComfyUI с намерением пополнить свою коллекцию изображений коиков в смешных шляпах, сперва работает урезанная версия вполне себе полноценной БЯМ Qwen3 разработки Alibaba Cloud, и только затем — формально выходящая за условный порог «малости» специализированная на рисовании модель. Более того, ничто не мешает запускать на ПК, пусть даже довольно скромном в плане производительности, если не совсем уж полноценные (с триллионами параметров и контекстными окнами в сотни тысяч, а то и миллионы токенов) мультмодальные языковые модели: ведь веса множества их в последнее время свободно доступны для загрузки. Недаром таким спросом в последнее время пользуются далеко не самые мощные настольные компьютеры Mac Mini: благодаря фирменной архитектуре, обеспечивающей прямой доступ графического и/или нейронного процессора к общей оперативной памяти, они особенно хорошо справляются не просто с локальным исполнением ИИ-моделей, но с довольно ресурсоёмкими агентными задачами. И на слабеньком x86-ПК такое тоже возможно, — что мы сейчас наглядно и продемонстрируем.

#Глаза разбегаются

Сразу оговоримся, что в рамках настоящего материала мы не будем проводить сравнительных испытаний — ни в принципе доступных для исполнения на ПК моделей, ни даже предназначенных для их запуска сред. Разнообразие тех и других достаточно велико, а критерии оценки весьма размыты: кому-то важно адекватное распознавание речи, чтобы переводить аудиозаписи в текстовую форму, кто-то делает ставку на локальный вайб-кодинг, а кого-то просто привлекает возможность поболтать с виртуальным собеседником на приватные темы — с полной уверенностью, что ни единый токен из этих разговоров не просочится в интернет, который, как известно, помнит всё. Для каждой из этих задач, а также для множества других, существуют подходящие локальные ИИ-инструменты, и более предметно мы изучим их в следующий раз. Сегодня же наша цель — изложить на живых примерах сам принцип развёртывания рабочей среды и запуска избранной модели в ней, а также указать на неизбежные ограничения, накладываемые на ИИ скудным «железом» старенькой персоналки. Ну и в итоге — помочь пытливому читателю разобраться, стоят ли перед ним в принципе такие задачи, ради которых имеет смысл городить весь этот программный огород? И не проще ли обращаться всякий раз к облачным БЯМ — тем более, что даже те из них, что доступны бесплатно и без регистрации, и по скорости работы, и по широте возможностей (число параметров, количество запускаемых для обработки каждого запроса агентов и проч.) заведомо превосходят исполняемые локально модели?

 Сред для запуска локальных ИИ доступно множество, в том числе и с открытым кодом, — здесь приведено лишь начало весьма пространного списка (источник: скриншот сайта infrabase.ai)

Сред для запуска локальных ИИ доступно множество, в том числе и с открытым кодом, — здесь приведено лишь начало весьма пространного списка (источник: скриншот сайта infrabase.ai)

Больно писать такое с учётом нынешних расценок на аппаратное обеспечение, но актуальные рекомендации для сборки ПК, ориентированного на исполнение ИИ-задач, включают видеокарту с 16 Гбайт памяти и оперативную память в объёме 64 Гбайт — как раз из тех соображений, что даже достаточно крупные модели, целиком во VRAM не умещающиеся, прекрасно (хотя и куда медленнее) будут работать с частичной выгрузкой в общую память. На уровне самой ОС Windows (в отличие от macOS) такой возможности не предусмотрено, но достойные внимания среды для локального запуска ИИ справляются с этой задачей сами. Наиболее популярные среди них, пожалуй, — это Ollama (открытый код; особенно придётся по душе поклонникам работы в командной строке, хотя и GUI там имеется) и LM Studio Bionic (проприетарная; с весьма дружественным к пользователю графическим интерфейсом и массой функциональных возможностей).

Мы для демонстрационных целей остановимся на проекте с открытым кодом Unsloth Desktop: это достаточно универсальная рабочая среда для решения ИИ-задач, позволяющая — с применением подходящих для того локальных моделей, разумеется, — вести с пользователем текстовые диалоги, рисовать для него статичные картинки и генерировать видео. Она способна привлекать по мере надобности Claude Code, Codex и иные внешние проприетарные агенты (оплатой доступа к тем и получением соответствующих ключей следует озаботиться заранее), вести «умный» веб-поиск в исследовательском режиме (deep research) с предварительным составлением плана изысканий и привлечением значительного числа источников, создавать программный код и т. д. Правда, следует отметить, что наш тестовый ПК (Windows 10, Core i7-2700K, 24 Гбайт DDR3-1333, GeForce GTX 1070 с 8 Гбайт видеоОЗУ) далеко не со всеми этими задачами справится. Нет, формальных преград-то немного, — если модель помещается в суммарный объём VRAM+RAM (минус занимаемое в памяти операционкой и служебными программами место), исполняться она будет. Но вот скорость… Впрочем, обо всём по порядку.

 Если сайт корректно определил разновидность операционной системы, закачать установочный пакет Unsloth Desktop можно одним нажатием клавиши (источник: скриншот сайта unsloth.ai)

Если сайт корректно определил разновидность операционной системы, закачать установочный пакет Unsloth Desktop можно одним нажатием клавиши (источник: скриншот сайта unsloth.ai)

#Просто добавь GGUF

Одна из причин, по которым именно Unsloth Desktop разумно рекомендовать начинающим энтузиастам локального ИИ, — обширная и детальная документация на сайте проекта. Она охватывает как основные понятия из области языковых моделей и рекомендации по выбору наиболее подходящей для той или иной задачи БЯМ/МЯМ, так и вдумчивые описания развиваемой этим коллективом исследователей концепции динамической квантизации GGUF, или GPT-Generated Unified Format (на момент написания настоящей статьи — в версии Dynamic v3.0, с примерно на 10% повышенным качеством интерпретации и исполнения пользовательских подсказок по сравнению с другими способами сжатия, дающими файл модели примерно того же размера). Системные требования для установки рабочей среды под Windows 10/11 или ОС с ядром Linux формально даже не включают GPU: GGUF-модели будут исполняться и на CPU с использованием обычной оперативной памяти. Правда, работать станут значительно медленнее, и функциональность их окажется исключительно текстовой: рисовать картинки и тем более генерировать видео на настолько картошке в качестве «железа» смысла решительно нет. Платформы же под управлением macOS поддерживаются начиная с версии 12 (Monterey).

 Имеет смысл запомнить, в какой каталог система установит Unsloth Desktop, либо указать на этом этапе инсталляции более короткий и запоминающийся путь: это пригодится, если захочется добавить в рабочую сред файлы моделей (закачанных ранее, например) вручную

Имеет смысл запомнить, в какой каталог система установит Unsloth Desktop, либо указать на этом этапе инсталляции более короткий и запоминающийся путь: это пригодится, если захочется добавить в рабочую сред файлы моделей (закачанных ранее, например) вручную

После загрузки установочного пакета — процедура вполне самоочевидная, достаточно просто кликать мышкой на «Далее», если нет намерения что-то менять, а у новичков в этом деле его обычно и нет, — и первого запуска рабочей среды будет предложено выбрать модель из весьма обширного перечня поддерживаемых. «Поддерживаемых» в данном случае равнозначно «доступных из репозитория Unsloth на Hugging Face»: после того, как пользователь определится с тем, что ему нужно, на вкладке «Хаб моделей», справа в окне рабочей среды появится панелька с подсвеченной именно для его актуальной конфигурации разновидностью GGUF-файла (они, напомним, различаются глубиной и степенью динамичности квантизации). Можно, конечно, пренебречь рекомендацией системы и загрузить иной вариант, на свой вкус, — но сильнее квантизированные будут работать хуже (в смысле интерпретации запросов оператора и качества их исполнения), а те, что сжаты слабее, потребуют больше времени в каждом сеансе, т. к. генерация каждого токена для них будет занимать больше времени.

 При наведении мышкой на название выбранной для загрузки через «Хаб» модели рабочая среда выдаёт комментарий о том, что при необходимости частично выводить её веса за пределы VRAM придётся смириться с падением скорости

При наведении мышкой на название выбранной для загрузки через «Хаб» модели рабочая среда выдаёт комментарий о том, что при необходимости частично выводить её веса за пределы VRAM придётся смириться с падением скорости

Особенно заметно это в том случае, если GGUF-файл модели не помещается в видеопамять графического адаптера целиком. Рабочая среда позаботится о частичной выгрузке нейросетевых весов в системное ОЗУ, конечно, но скорость генерации токенов снизится драматически. Забегая несколько вперёд, отметим, что если при работе с моделью Qwen 3.5 9B (квантизация Q_4_M, размер файла 5,4 Гбайт, целиком помещается во VRAM) токены генерировались в среднем темпе 6−8 единиц в секунду, то более современная и крупная Qwen 3.8 27B (квантизация Q_4_0, 16,1 Гбайт) работала, да, — но всего лишь в темпе 0,2−0,3 токена в секунду. И та, и другая скорости, вообще говоря, патетически малы по сравнению с теми, что обеспечивают полнофункциональные облачные БЯМ, — но зато всё тут своё, офлайновое!

#Кладезь (неточной) мудрости

После того, как модель выбрана и загружена (время закачки зависит, понятное дело, от возможностей вашего канала связи с интернетом), остаётся нажать на появившуюся в правой части окна зелёную кнопку «Run» и начать новую сессию. Остановимся н секунду и зададимся не самым очевидным на этом этапе вопросом: а зачем, собственно? Как мы уже отмечали, в Сети полным-полно облачных БЯМ на любой вкус и кошелёк, в том числе бесплатных. Возможности последних ограниченны, конечно, но и те дистиллированные/квантизованные версии, что запустятся локально на нашей картофелине, тоже звёзд с неба хватать явно не будут. Вот простой пример: мы попросили обе развёрнутые для пробы в Unsloth версии Qwen описать логотип издания 3DNews. Та, что постарше и покомпактней, версии 3.5, действуя полностью локально, утверждала, что цветовая гамма литер «3D» — красно-оранжевая, и хотя не смогла изобразить логотип в виде рисунка, породила код для SVG-файла, который при открытии в браузере действительно демонстрирует две броские алые тройки — именно две тройки, хотя в текстовом описании логотипа явно упоминаются литеры «3» и «D», — за которыми следуют чёрные «news». У версии 3.8 получилось чуть лучше, — там надпись «3Dnews» читается более внятно, но всё равно цветовая гамма явно не та, что каждый может наблюдать на нашем сайте.

 Вы будете смеяться, но так выглядит логотип 3DNews по версии локальной  Qwen 3.5 9B с отключённым в интерфейсе Unsloth Desktop параметром «Search», то бишь без возможности справиться о нём онлайн

Вы будете смеяться, но так выглядит логотип 3DNews по версии локальной Qwen 3.5 9B с отключённым в интерфейсе Unsloth Desktop параметром «Search», то бишь без возможности справиться о нём онлайн

И только при активизации режима «Search», что подразумевает обращение модели к внешним источникам данных (кстати, придётся выдать Unsloth Desktop соответствующее разрешение, когда всплывёт предупредительное окошко брандмауэра Windows), модель внятно описала первые две литеры логотипа как ярко-синие. Мелочь, конечно, — но она свидетельствует о некой априори некорректной записи в исходном наборе данных, на которых обучали обе исходные БЯМ, Qwen 3.5 и 3.8: вряд ли это рядовая галлюцинация, если модели из разных подпоколений в один голос утверждают, что «3D» в нашем логотипе должны быть ярко-красными. А это, в свою очередь, заставляет снова поднять заданный уже не раз вопрос: для чего использовать локальный ИИ, если затраты на это довольно велики (оцените, в какую сумму обойдётся сегодня актуальный ПК для уверенного запуска и сравнительно быстрого исполнения 20-Гбайт по размеру файла с параметрами моделей), а выгоды, скажем так, не слишком-то очевидны.

Если речь идёт о рисовании и тем более видео«съёмках» в латентном пространств, тут как раз всё понятно: хороших бесплатных и не обременённых ограничениями (на размер картинки, на число генераций за определённый период времени и т. д.) моделей такого рода в Сети практически нет. А ограничения весьма болезненны, если оператора не удовлетворяет свежесгенерированная нейробурда (AI slop): в стремлении если не к совершенству, то хотя бы к приемлемому результату непременно захочется многократно подправлять в целом удачное, но не совершенное изображение или ролик. И делать это лучше как раз на собственном компьютере, не неся дополнительных затрат; тут даже не самый мощный ПК придётся как нельзя более кстати. Но для картинок и видео есть свои специализированные рабочие среды вроде упоминавшегося уже ComfyUI. Там же, кстати, и средства запуска квантизированных больших моделей для текстовой коммуникации имеются: есть ноды, при помощи которых можно, к примеру, скормить мультимодальной модели картинку, чтобы ИИ в деталях её описал — а затем это описание использовать уже для следующей генерации.

 Вы снова будете смеяться, но здесь Qwen 3.8 27B с активированным доступом в Сеть пытается изобразить всё тот же логотип ASCII-символами. Выходит… ну, скажем так, спорно

Вы снова будете смеяться, но здесь Qwen 3.8 27B с активированным доступом в Сеть пытается изобразить всё тот же логотип ASCII-символами. Выходит… ну, скажем так, спорно

#И всё-таки оно генерируется

Не будем даже пытаться задавать исполняемым локально моделям сложные для любого ИИ вопросы — чей Крым чьи Сенкаку, сколько будет 7563 умножить на 742 в восьмеричной системе счисления, как поживают медведи в космосе и т. д.: с ними и онлайновые-то монстры со многими триллионами параметров не всякий раз ладят; что уж говорить о помещающихся в жалкие несколько десятков гигабайт дистиллированных и пережатых малютках. Во времена BERT разумность запуска БЯМ на персональном компьютере не вызывала ни малейших сомнений, поскольку модель без труда умещалась в памяти не самой мощной дискретной видеокарты. Сегодня же какая-нибудь DeepSeek-V4-Flash в квантизации Q8_K_XL, занимая под 170 Гбайт, пусть и допускает исполнение в среде Unsloth (если в системе достаточно суммарной оперативки), в любом случае будет работать медленнее, чем если её же развернуть в облаке. Причём, стоит поделить розничную цену достаточного для запуска такой модели ПК на стоимость одного (её же) токена по тарифам облачных провайдеров, поневоле задумаешься — а стоит ли локальная овчинка выделки? Может, ну его, это мещанское стремление расставить всё непременно по персональным полочкам, и пора уже, проникнувшись духом гиганомики, переносить всю сколько-нибудь значительную вычислительную нагрузку в облака?

Отнюдь; противопоставлять облачные и локальные ИИ-вычисления решительно незачем: у них довольно глубоко пересекающиеся, но всё же различные области решаемых наилучшим образом задач. Облачные БЯМ, доступные через веб-интерфейсы либо API (в том же Unsloth, кстати) привлекательны высокой скоростью работы, отсутствием необходимости вручную подкручивать параметры работающей модели, обширностью палитры решаемых мультимодальных задач. На стороне же локальных ИИ — конфиденциальность, отсутствие волюнтаристских запретительных барьеров (добавочных guardrails — сверх тех, что внедрены в саму модель на этапе тренировки), фиксированная стоимость и независимость от наличия доступа к интернету в данный конкретный момент. В среде активных пользователей ИИ, можно сказать, формируется довольно основательный консенсус: облачные БЯМ хороши для сложных, но неперсонифицированных разовых задач; локальный ИИ — для конфиденциальных и/или тех, что повторяются регулярно.

 Занятно, что рассуждающие облачные БЯМ (в данном случае — Claude Haiku 4.5), когда их просят изобразить логотип, на что они в данном интерфейсе не способны, не пытаются генерировать SVG или ASCII-код, а честно посылают направляют спрашивающего по заведомо содержащему искомые сведения адресу (источник: скриншот сайта Duck.ai)

Занятно, что рассуждающие облачные БЯМ (в данном случае — Claude Haiku 4.5), когда их просят изобразить логотип, на что они в данном интерфейсе не способны, не пытаются генерировать SVG или ASCII-код, а честно посылают направляют спрашивающего по заведомо содержащему искомые сведения адресу (источник: скриншот сайта Duck.ai)

Последнее замечание особенно важно: да, облачная модель несравненно лучше локальной справится с решением очередной задачи из списка Эрдёша или с созданием правдоподобного реалистичного видеоролика минут на пять по скупой подсказке «экранизация сказки о трёх поросятах, визуальная стилистика советско-венгерского фильма „Мама“, цветовая гамма как в кинофильмах 1970-х». Но потребность в такого рода сверхусилиях на практике возникает редко; повседневно же людям нужно писать резюме, превращать лапидарный черновик электронного письма в удобочитаемый и не вызывающий отторжения текст, быстрое анализировать фрагмент программного кода без единой строчки комментариев ради понимания того, что именно он делает и т. д. Даже банальное преобразование речи в текст — расшифровка рабочего совещания с разбивкой по спикерам и с тайм-кодами — желательно производить внутри периметра информационной безопасности предприятия; мало ли, какие вопросы там могли подниматься. Таким образом, выбор в пользу локального ИИ для множества приложений — именно рабочих, подчеркнём снова, прикладных, а не исследовательских или развлекательных — всё явственнее становится практичным вариантом по умолчанию. Какие же именно задачи разумнее исполнять локально, если доступное аппаратное обеспечение позволяет это делать в разумной скоростью — с обработкой хотя бы единиц, а лучше десятков токенов в секунду?

Написание сценариев оболочки (shell scripting). Область довольно узкая, даже далеко не всем программистам такой код необходимо создавать на регулярной основе. Но уж если приходится писать скрипты на bash или Python, это может стать настоящим мучением. Создаст ли облачная БЯМ адекватный shell script по простому текстовому описанию с указанием всей необходимой конкретики? Бесспорно; причём заведомо быстрее локальной модели. Зато чтобы такой скрипт сразу же заработал как следует, придётся поделиться с облаком такими сведениями о своей локальной или сетевой инфраструктуре, как пути к файлам, структура внутренних папок, идентификаторы серверов и т. д. А сегодня любая утечка специфичной информации такого рода — заметная потенциальная угроза, потому что кибератаки тоже организуют при помощи ИИ, и аргумент «да кому я нужен, кто вообще сумеет связать эти обрывочные сведения именно с моей локальной сетью» уже не звучит так же убедительно, как всего лишь пять лет назад. И ещё один момент: чтобы написать корректный скрипт, не слишком уверенно владеющему синтаксисом выбранной оболочки программисту требуется тратить немало времени, переключаясь между редактором кода и браузером, где открыта справочная страница, что и замедляет работу, и мешает концентрировать мысли. Локальный же ИИ не просто выдаст некую последовательность команд, но сможет пояснить любую из них (а также логику выбора каждой) дополнительно и сколь угодно глубоко — не расходуя притом драгоценных облачных токенов. Таким образом программист не извлекает некую чудесным образом работающую китайскую грамоту из чёрного ящика, а постепенно пополняет багаж собственных знаний в области скриптов — что делает его увереннее, продуктивнее и в целом по-человечески лучше.

 В режиме Thinking локальная Qwen 3.8 27B сперва составляет план действий по получению запрашиваемого результата, и только после его утверждения пользователем (план можно редактировать, кстати) приступает к делу

В режиме Thinking локальная Qwen 3.8 27B сперва составляет план действий по получению запрашиваемого результата, и только после его утверждения пользователем (план можно редактировать, кстати) приступает к делу

Программирование per se. Речь идёт не о создании прорывных суперприложений, а о повседневных задачах кодеров: реализация служебных функций, генерация шаблонов, проверка синтаксиса, базовая отладка и проч. Здесь конфиденциальность особенно важна, поскольку такой рутинный код во множестве случаев содержит логику бизнес-процессов компании, учётные данные приобретённых ею API, ценные комментарии живых программистов с пояснениями по части архитектуры приложений и многое другое. При разработке коммерческого продукта переправлять такую информацию в облако значит значительно повышать риск её утечки.

Обобщение (составление кратких выжимок из) конфиденциальных документов. Это могут быть и рабочие файлы — контракты, записи кадрового учёта, медицинские карты, налоговые декларации — так и личные финансовые файлы, например. Тут всё предельно прозрачно: какие бы меры защиты ни декларировал облачный провайдер, всегда имеется информация, которой по-хорошему не стоит покидать физического объёма той персоналки или того сервера, где она хранится. И, кстати, особенно замечательно то, что обобщение — одна из наиболее простых задач, которые ИИ, включая не самый продвинутый локальный, умеет решать хорошо, без необходимости привлекать сложные контура рассуждений, с минимальными потерями смысла и минимальным же процентом ошибок; да и контекстное окно здесь требуется вовсе не гигантских размеров. Более того зачем останавливаться на банальном обобщении? Локальная модель с успехом классифицирует и рассортирует (если дать ей доступ к записи на логический раздел) скопившиеся в беспорядке файлы, проиндексирует изображения в больших неструктурированных каталогах, сгенерирует рефераты на основе достаточно крупных подборок документов — включая притом самые чувствительные, выгружать которые в облако (либо доверять просмотр который действующему через API облачному же агенту) может быть опрометчиво.

 Желаете исполнить локально DeepSeek-V4-Pro-0813? Нет ничего проще; в квантизации UD-Q4_K_XL она занимает всего-то 850 Гбайт. Убедитесь, что в системе достаточно оперативной памяти, — и вперёд!

Желаете исполнить локально DeepSeek-V4-Pro-0813? Нет ничего проще; в квантизации UD-Q4_K_XL она занимает всего-то 850 Гбайт. Убедитесь, что в системе достаточно оперативной памяти, — и вперёд!

Post mortem рабочих (и не только) совещаний. Не просто превратить аудиозапись в текст, но извлечь из этого словесного потока структурированную, чёткую информацию — кто, что и по какому поводу сказал, — вот огромное благодатное поле деятельности для локального ИИ. Это практически идеальное приложение для него: требования к конфиденциальности — очень высокие, регулярная необходимость обработки — присутствует (совещания следуют одно за другим), предсказуемость структуры и тематики высказываний, что способствует снижению вероятности ошибок и галлюцинаций, — налицо. И, кстати, на персональном уровне это тоже работает: одно только извлечение сути из пространных голосовых сообщений в мессенджерах (без необходимости оплачивать премиальную подписку) чего стоит! Да, локальный ИИ будет чаще врать при распознавании повседневной речи — когда ораторы торопятся, мямлят или увлекаются идиоматическими выражениями, — но отсутствие необходимости регулярно тратить на ту же самую работу облачные токены (плюс неизбежный риск утечек) перевешивает всё.

Любая рабочая рутина. Локальная БЯМ для множества офисных работников имеет все шансы превратиться в этакого в меру расторопного, звёзд с неба не хватающего, но в целом добросовестного секретаря: именно по этой причине столь взрывную популярность приобрёл локальный как раз ИИ-агент ClawdBot. Объяснить, что значит выданное программой сообщение об ошибке, переписать в подобающей тональности — без потери сути притом — слишком резко составленное электронное письмо; предложить несколько идей разной степени безумности в ходе мозгового штурма — для всего этого бесплатная (за вычетом стоимости электроэнергии, ну и об инвестициях в «железо» не будем вспоминать) модель подойдёт куда лучше самой натренированной облачной. Локальному ИИ не требуется превосходить облачную БЯМ по всем параметрам, да он на это и не способен. Его сила в другом, а именно — в постоянной доступности, в отсутствии переплат за дополнительные вопросы и в заведомо недостижимом для больших моделей уровне конфиденциальности.

 И в локальном варианте рассуждающая Qwen 3.8 27B прекрасно понимает визуальные шутки: приведённый для наглядности во врезке бородатый мем с просторов интернета был ею истолкован вполне адекватно

И в локальном варианте рассуждающая Qwen 3.8 27B прекрасно понимает визуальные шутки: приведённый для наглядности во врезке бородатый мем с просторов интернета был ею истолкован вполне адекватно

Так что если вам необходимо, чтобы искусственный интеллект вёл чрезвычайно сложные рассуждения, располагал контекстным окном в половину объёма текстов Библиотеки Конгресса и непрерывно сверялся по каждому вопросу с самыми свежими новостями из интернета — тогда, разумеется, вариантов нет: только облачные БЯМ. В противном же случае есть смысл дать шанс локальным — если для того имеется хоть мало-мальски пригодна аппаратная возможность. Тем более, что достойные внимания модели с открытыми весами появляются всё чаще и умеют всё больше, тогда как рутинные и далеко не запредельные по сложности задачи, которые перед ними ставят, отнюдь не усложняются. Примеры таких задач и успешного их решения локальным ИИ на нашей картошке мы приведём в следующей «Мастерской».



Оригинал материала: https://3dnews.ru/1147364