DEV Community

Cover image for Нейросеть без интернета в 2026 году: что реально потянет ваш ноутбук и телефон
Promptra Team for provod.ai

Posted on

Нейросеть без интернета в 2026 году: что реально потянет ваш ноутбук и телефон

Разбираем, где офлайн-модель экономит время и приватность, а где превращается в медленную игрушку дороже подписки.

Когда человек ищет «нейросеть без интернета», он обычно имеет в виду две разные вещи: желание не отправлять переписку в чужое облако — и надежду, что локальная модель заменит привычный ChatGPT или Claude один в один. Это разные задачи, и цена ошибки в них разная. В тесте PCWorld, опубликованном 18 марта 2025 года, задача генерации HTML на 70-миллиардной модели дала журналисту 1,68 токена в секунду и 66,6 секунды ожидания до первого символа — на ноутбуке HP Elitebook X G1a с 64 ГБ памяти и отдельным NPU, то есть далеко не на бюджетной машине. А независимый исследователь Саймон Уиллисон в 2026 году получил на другой локальной модели, Qwen3.6-27B, 25,57 токена в секунду и назвал результат «выдающимся для локальной модели весом 16,8 ГБ» — источник. Всю разницу задают два параметра: железо и выбранная модель.

Откуда берётся разброс в 15 раз

Правило из практики простое: примерно 1 ГБ оперативной памяти на каждый миллиард параметров модели, отмечает MIT Technology Review — материал MIT Technology Review. Но это только веса. PCWorld фиксирует, что даже скромная модель на 7–8B параметров требует 4,5–5 ГБ под саму модель, а для комфортной повседневной работы автор теста считает нужным минимум 32 ГБ RAM — тест PCWorld. Тот же материал MIT Technology Review описывает, как 14-миллиардная модель влезла в 16 ГБ ноутбука только после закрытия почти всех остальных приложений, а на iPhone 12 без современного Neural Engine результат оказался ещё хуже: модель «уходит в странные тангенты» и постоянно галлюцинирует — проверка MIT Technology Review. Телефонную часть этого теста стоит читать с поправкой: iPhone 12 — устаревшее устройство, и флагманы 2026 года ведут себя иначе.

Квантизация — способ ужать модель без переобучения — работает здесь как размен точности на размер, и размен этот не бесплатный. Таблица перплексии из репозитория llama.cpp для 7B-модели показывает: Q4_K_M весит 3,8 ГБ и теряет +0,0535 к перплексии, а Q8_0 весит 6,7 ГБ и теряет всего +0,0004 — обсуждение llama.cpp. То есть агрессивная квантизация освобождает гигабайты памяти почти без потери качества предсказаний — но «почти без потери» и «без потери» не синонимы, и на длинных диалогах разница накапливается.

Что реально работает на телефоне

На Android без облака через ML Kit GenAI API уже доступны генерация текста, суммаризация, исправление орфографии, переписывание, описание изображений и распознавание речи — целиком офлайн, на Gemini Nano — документация Android Developers. Но официальный лимит входного текста для офлайн-суммаризации — около 4000 токенов, это примерно 3000 английских слов. Лимит относится именно к этому API и не описывает общий потолок всех офлайн-функций Gemini Nano — блог Android Developers. Если планируете загружать в офлайн-суммаризатор длинную статью или протокол встречи, для основного разбора вопроса это узкое место, о котором нужно знать заранее.

У Apple похожая история с порогом памяти. Самая мощная офлайн-модель в iOS 27 требует минимум 12 ГБ единой памяти — из-за этого её не получает стандартный iPhone 17 с 8 ГБ, только Pro-версии и iPhone Air — материал MacRumors. Пользователи, купившие обычный iPhone 17 в расчёте на заявленные ранее возможности Apple Intelligence, отреагировали на это недовольством — реакция анекдотическая, без опроса и цифр, но показательная: маркетинг «Apple Intelligence на этом устройстве» и «максимальная офлайн-модель на этом устройстве» — не одно и то же обещание.

На стороне компактных моделей всё честнее. Gemma 4 E2B весом 2,54 ГБ через приложение Google AI Edge Gallery, по личной оценке Уиллисона, работает на iPhone быстро и «реально хорошо и полезна» — заметка Simon Willison. Это субъективный отзыв одного пользователя без замера токенов в секунду, но он совпадает с логикой: 2–4B — реалистичный офлайн-класс для телефона, 27B и выше — уже нет.

Возражение, которое нельзя игнорировать

Обозреватель PCWorld Мэттью Смит подводит итог жёстко: «Just because you can doesn't mean you should» — просто потому что можешь запустить, не значит, что стоит — вывод PCWorld. Участники обсуждения на Tildes добавляют цифры: на среднем железе скорость держится в районе 2–7 токенов в секунду, контекстное окно локально ограничено 50–60 тысячами токенов против 200 тысяч у облачных сервисов, а квантизация Q4 снижает качество примерно на 10% — при этом подписка вроде Claude Pro за 20 евро в месяц обходится дешевле апгрейда железа, достаточного для серьёзной локальной работы — обсуждение Tildes. Это чистая экономика: если цель — максимальное качество и большой контекст, офлайн проигрывает по деньгам и по возможностям одновременно.

Возражение бьёт мимо цели ровно в одном месте — оно меряет офлайн-модель мерками облачной замены, хотя задача у неё другая. Директор по цифровой политике Demos Элизабет Сегер формулирует, зачем вообще идти в локальные модели, несмотря на все неудобства: «If something is free, you're the product» — если что-то бесплатно, товар — это вы — MIT Technology Review — как запустить LLM на своём ноутбуке. Человек, который хочет обсуждать медицинские симптомы, черновики контрактов или личную переписку, взвешивает приватность против удобства — и в этой системе координат счёт другой.

Где проходит реальная граница пользы

По совокупности данных вырисовывается вполне конкретный список задач. На ноутбуке с 16–32 ГБ RAM базовый практичный класс — модели 7–8B: при правильной квантизации они закрывают чат, суммаризацию и черновики кода. 27B — уже верхняя граница для мощных конфигураций или отдельных хорошо квантизованных сборок; её стоит считать рабочей только после проверки на своём железе. Тест на Habr на стенде с 64 ГБ RAM и RTX 3050 показал, что gemma3:4b отвечает за 6 секунд, mistral:7b — за 10, а специализированная qwen3-coder:30b даёт лучшие результаты именно в коде — тест Habr. Блог ИТМО отдельно рекомендует семейство Qwen как предпочтительный выбор для русского языка, кода и агентных сценариев по сравнению с другими компактными моделями — обзор ИТМО. А модель Ornith-1.0 — 35B MoE, GGUF на 20 ГБ — по первым впечатлениям Уиллисона выдаёт около 103 токенов в секунду и уверенно держит агентный харнесс с множеством вызовов инструментов — разбор Ornith-1.0, хотя измерялось это на его личном мощном железе, а не на типичном ноутбуке.

Практический ориентир — таблица по параметрам, памяти, квантизации и реалистичной скорости на среднем ноутбуке:

Параметры модели Память под веса Рекомендованная квантизация Реалистичная скорость
2–4B (Gemma E2B и аналоги) ~2,5–3 ГБ Q4_K_M / Q5 Комфортно на телефоне и слабом ноутбуке, короткие задачи
7–8B 4,5–5 ГБ под веса; 16 ГБ RAM — нижняя граница запуска при закрытых приложениях, 32 ГБ — более реалистичный минимум для повседневной работы Q4_K_M (3,8 ГБ) для скорости или Q8_0 (6,7 ГБ) для точности 6–10 сек на простой запрос, 2–7 ток/с на диалоге
14B ~14 ГБ Q4_K_M Работает на 16 ГБ, только если закрыть остальные приложения
27B 16,8 ГБ Q4_K_M 25,57 ток/с — но на мощном Mac/RTX 5090, не на среднем ноутбуке
30B, плотная (qwen3-coder:30b) ~18 ГБ в Q4 (оценка по пропорции к Q4_K_M 27B-модели, 16,8 ГБ) Q4_K_M Habr-тест на стенде с 64 ГБ RAM и RTX 3050: лучшие результаты именно в коде, скорость отдельно не замерялась
35B MoE (Ornith-1.0) 20 ГБ (GGUF) Q4_K_M GGUF ~103 ток/с у Уиллисона на его мощном личном железе, не на ноутбуке; сильна в агентных сценариях
70B 40+ ГБ Q4 1,68 ток/с, 66,6 сек до первого токена даже на 64 ГБ с NPU — избегать на ноутбуке

Прежде чем доверять модели приватные данные, стоит проверить конкретную сборку на своей задаче: все цифры выше получены на чужом железе. Методика из статьи на vc.ru предлагает собрать 20–50 эталонных примеров и оценивать модель по четырём критериям сразу: качество ответов, скорость, потребление ресурсов и стабильность поведения — методика vc.ru. Это час работы, который избавляет от ситуации, когда офлайн-ассистент подводит именно на той задаче, ради которой его ставили.

Гибридная схема вместо выбора «либо-либо»

Разумная тактика — развести задачи между офлайном и облаком раз и надолго. То, что должно остаться приватным и не требует сложных рассуждений — суммаризация, черновик письма, набросок функции — идёт на локальную 7–8B или 27B модель. То, что упирается в контекст 50–60К токенов или требует более сильной модели, разумно отправлять в облако, но не привязываясь к одному вендору намертво. Здесь применим provod.ai: совместимый с OpenAI-протоколом клиент можно подключить заменой base URL и API key, а модели выбирать из текущего каталога provod.ai в пределах поддерживаемых параметров запроса.

Экономика из возражения Tildes тоже не универсальна для российского читателя: подписка на Claude Pro или ChatGPT Plus за 20 евро в месяц предполагает загранкарту и часто VPN. Оплата через provod.ai рублями — картой РФ, СБП или по счёту — снимает именно это неудобство; выбор между офлайном и облаком она за вас всё равно не сделает.


provod.ai — современные AI-модели с доступом из России

Работайте без VPN и зарубежной банковской карты: модели доступны через единый API и веб-интерфейс, а баланс пополняется в рублях.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Доступ из России не означает более дорогие токены: цена остаётся 1:1 с официальной ценой модели, без собственной наценки provod.ai; для бизнеса есть договор и закрывающие документы.

Подключите нужную модель через provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · реквизиты для бизнеса

Источники

Top comments (0)