ТОП-10 серверов для нейросетей и ИИ в 2026 году

Запустить языковую модель у себя перестало быть задачей для исследовательской лаборатории. Веса моделей на 7 и 13 миллиардов параметров лежат в открытом доступе, а инструменты вроде llama.cpp и Ollama поднимаются на обычной машине с Linux за десять минут. Дальше начинается арифметика: сколько памяти займут веса, хватит ли обычного процессора или нужна видеокарта, и во сколько всё это обойдётся в месяц. Мы разобрали десять площадок, где можно арендовать сервер для нейросетей, и свели их к понятным цифрам.

В этом обзоре мы идём от задачи, а не от красивых характеристик. Сначала считаем, сколько видеопамяти и оперативной памяти реально нужно под модели разного размера, потом смотрим, у кого из провайдеров есть подходящие конфигурации и по какой цене. Материал пригодится тем, кто хочет держать инференс — то есть запуск уже обученной модели на готовых весах — на своём железе, а не платить за каждый запрос к чужому API.

Как мы отбирали

Для работы с моделями важны не те параметры, на которые смотрят при выборе хостинга под сайт. Здесь почти не имеет значения количество трафика и число сайтов на тарифе, зато критичны объём оперативной памяти, число ядер и скорость диска: веса модели на 13 миллиардов параметров в квантованном виде — это файл на 7–9 ГБ, и его нужно быстро прочитать в память при каждом старте.

Мы смотрели на реальные потолки конфигураций, а не на маркетинговые обещания, и на то, можно ли расти внутри одного провайдера без переезда. Итоговые критерии выглядели так:

  • потолок по оперативной памяти и числу ядер — есть ли куда масштабироваться выше стартового тарифа;
  • тип дисков: NVMe читает веса моделей заметно быстрее, чем обычный SSD, и это влияет на время холодного старта;
  • количество тарифов — чем их больше, тем точнее подбирается конфигурация под конкретную модель без переплаты;
  • география площадок: близкий дата-центр даёт меньшую задержку при работе через API;
  • срок работы провайдера на рынке и оценка пользователей, потому что долгие вычисления не любят внезапных перезагрузок.

1. JustHost.ru

Сайт хостинг-провайдера JustHost.ru — тарифы VPS для запуска нейросетей

JustHost.ru работает с 2006 года и держит линейку из 27 тарифов, все — на NVMe-дисках. Потолок в 12 ядер и 32 ГБ оперативной памяти звучит скромно на фоне облачных гигантов, но именно эта планка закрывает самый частый сценарий: запуск модели на 7 миллиардов параметров в квантовании Q4 прямо на процессоре, без видеокарты. Такая модель занимает примерно 4–5 ГБ, а с запасом под контекст диалога комфортно укладывается в 16 ГБ.

Провайдер интересен предсказуемостью: тарифная сетка небольшая, разброс цен понятный, а начальная точка входа — одна из самых низких среди участников подборки. Из редких для рынка деталей — оплата криптовалютой, что удобно, когда бухгалтерия не участвует в процессе и сервер оплачивает сам разработчик.

  • стартовая конфигурация: 1 ядро, 1 ГБ памяти, 20 ГБ NVMe;
  • цена: от 289 ₽ / мес;
  • потолок: до 12 ядер и 32 ГБ RAM;
  • 27 тарифов в линейке, все на NVMe;
  • восемь направлений размещения: Австрия, Албания, Бельгия, Болгария, Бразилия, Великобритания, Германия, Гонконг;
  • оценка пользователей — 4.5, на рынке с 2006 года.

Кому подойдёт: тем, кто впервые поднимает локальную языковую модель и хочет уложиться в бюджет до тысячи рублей в месяц. Для инференса модели на 7B в квантованном виде и для обслуживания телеграм-бота поверх неё ресурсов хватит, для 70B — нет.

Подробные характеристики и полный список тарифов — в обзоре JustHost.ru

2. Aéza

Панель управления и тарифы Aéza для аренды сервера под ИИ-задачи

Aéza — самый молодой участник подборки, на рынке с 2021 года, но по потолку конфигураций он обходит большинство остальных: до 96 ядер и 1024 ГБ оперативной памяти. Тысяча гигабайт RAM — это тот объём, при котором модель на 70 миллиардов параметров запускается на процессоре целиком, без квантования до низкой точности. Скорость генерации будет невысокой, но задача батчевой обработки документов ночью такой сценарий вполне терпит.

Вторая сильная сторона — 151 тариф. Это значит, что между «1 ядро, 2 ГБ» и «96 ядер, 1 ТБ» существует плотная лестница промежуточных вариантов, и можно двигаться по ней шагами, а не прыжками с двукратной переплатой. Серверы стоят в 13 странах, включая Москву, — для проекта с российскими пользователями это заметно сокращает время ответа.

  • стартовая конфигурация: 1 ядро, 2 ГБ памяти, 30 ГБ NVMe;
  • цена: от 593 ₽ / мес;
  • потолок: до 96 ядер и 1024 ГБ RAM;
  • 151 тариф, только NVMe-диски;
  • площадки в 13 странах, в подборке видны Австрия, Бразилия, Великобритания, Германия, Гонконг, Москва, Нидерланды, Польша;
  • оценка пользователей — 4.6, самая высокая в обзоре.

Кому подойдёт: командам, которые упёрлись в память на текущем сервере и хотят перейти к моделям на 30–70 миллиардов параметров, не меняя провайдера и не переписывая инфраструктуру развёртывания.

Подробные характеристики и полный список тарифов — в обзоре Aéza

3. Fornex

Хостинг Fornex — выбор тарифа VPS для работы с языковыми моделями

Fornex работает с 2007 года и предлагает 174 тарифа — вторая по величине сетка в подборке. Его особенность в другом: здесь на выбор доступны NVMe, SSD и обычные HDD. Для ИИ-проекта это не мелочь. Веса нескольких моделей, датасеты и чекпойнты занимают десятки и сотни гигабайт, но лежат мёртвым грузом — держать их на дорогом NVMe нет смысла, а вот дешёвый большой HDD под архив весов экономит ощутимую сумму.

Потолок по ядрам у Fornex скромный — 8 штук, зато памяти до 512 ГБ. Это перекос в сторону задач, где важен объём, а не скорость счёта: векторные базы для поиска по документам, кеш эмбеддингов, хранение индексов. География включает Германию, Индию, Испанию, Китай, Нидерланды, ОАЭ, Россию и США — набор нестандартный, полезный, если пользователи разбросаны по разным регионам.

  • стартовая конфигурация: 2 ядра, 1 ГБ памяти, 20 ГБ SSD;
  • цена: от 503 ₽ / мес;
  • потолок: до 8 ядер и 512 ГБ RAM;
  • 174 тарифа, диски NVMe, SSD или HDD на выбор;
  • серверы в 11 странах, включая Индию, Китай и ОАЭ;
  • оценка пользователей — 3.8, на рынке с 2007 года.

Кому подойдёт: проектам с поиском по своей базе документов, где основная нагрузка — держать в памяти большой векторный индекс и хранить рядом гигабайты исходников, а не выжимать максимум токенов в секунду.

Подробные характеристики и полный список тарифов — в обзоре Fornex

4. AdminVPS

AdminVPS — конфигурации серверов с большим числом ядер для инференса

У AdminVPS самый высокий в подборке потолок по ядрам — до 128. Когда модель считается на процессоре, скорость генерации почти линейно зависит от числа потоков, пока хватает пропускной способности памяти. Поэтому 128 ядер — это осмысленная конфигурация для батчевого инференса: одновременной обработки очереди из сотен запросов, когда важно не время ответа на один запрос, а общая пропускная способность за час.

Провайдер на рынке с 2009 года, в линейке 149 тарифов и диски трёх типов. География выделяется наличием Беларуси, Казахстана и Исландии наряду с Москвой и Германией — сочетание редкое и удобное, если нужно разнести обучающий контур и продакшн по разным юрисдикциям.

  • стартовая конфигурация: 1 ядро, 1 ГБ памяти, 15 ГБ NVMe;
  • цена: от 299 ₽ / мес;
  • потолок: до 128 ядер и 256 ГБ RAM;
  • 149 тарифов, диски NVMe, SSD или HDD;
  • серверы в 9 странах: Беларусь, Германия, Исландия, Казахстан, Москва, Нидерланды, Польша, Россия;
  • оценка пользователей — 4.5, на рынке с 2009 года.

Кому подойдёт: тем, у кого нагрузка идёт пачками — ночная разметка данных, массовая суммаризация писем, генерация описаний товаров для каталога. Много ядер здесь дают больше пользы, чем гигагерцы.

Подробные характеристики и полный список тарифов — в обзоре AdminVPS

5. ishosting

ishosting — европейский провайдер с широкой линейкой тарифов для ИИ-нагрузок

668 тарифов — это в четыре с лишним раза больше, чем у ближайшего преследователя по этому показателю. Практический смысл такого изобилия простой: конфигурацию можно подобрать почти точно под расчёт, а не брать ближайшую большую. Если вы посчитали, что вашей модели нужно 48 ГБ памяти, вы найдёте тариф на 48, а не будете платить за 64.

Потолок по памяти — 1152 ГБ, самый высокий в подборке; ядер до 64. Компания европейская, работает с 2017 года, и география у неё действительно самая широкая: Австралия, Австрия, Аргентина, Бельгия, Болгария, Бразилия, Великобритания, Венгрия и дальше по списку. Для сервиса с аудиторией на нескольких континентах это позволяет держать копии инференс-сервера ближе к пользователям.

  • стартовая конфигурация: 1 ядро, 1 ГБ памяти, 20 ГБ NVMe;
  • цена: от 608 ₽ / мес — самый высокий порог входа в подборке;
  • потолок: до 64 ядер и 1152 ГБ RAM;
  • 668 тарифов, диски NVMe, SSD или HDD на выбор;
  • самая широкая география площадок среди участников обзора;
  • оценка пользователей — 4.5, на рынке с 2017 года.

Кому подойдёт: тем, кто уже понимает свои требования в конкретных цифрах и не хочет округлять их вверх. Также — распределённым сервисам, которым нужны идентичные машины в разных частях света.

Подробные характеристики и полный список тарифов — в обзоре ishosting

6. 4VPS

4VPS — недорогие серверы для тестового контура ИИ-проекта

110 ₽ в месяц — самая низкая цена входа в подборке. За эти деньги дают 1 ядро, 1 ГБ памяти и 5 ГБ NVMe: языковую модель туда не поставить, но у такой машины есть своя роль в ИИ-проекте. На ней удобно держать оркестратор — небольшой сервис, который принимает запросы, ставит их в очередь и раздаёт тяжёлым машинам, а также веб-интерфейс и телеграм-бота.

Потолок у провайдера — 40 ядер и 94 ГБ памяти, диски только NVMe, а география охватывает 35 стран, включая Австралию, Австрию, Албанию, Армению, Бельгию, Бразилию, Великобританию и Германию. В линейке 568 тарифов, так что подняться от копеечной прокладки до рабочей машины под модель на 13B можно внутри одного личного кабинета.

  • стартовая конфигурация: 1 ядро, 1 ГБ памяти, 5 ГБ NVMe;
  • цена: от 110 ₽ / мес;
  • потолок: до 40 ядер и 94 ГБ RAM;
  • 568 тарифов, только NVMe-диски;
  • серверы в 35 странах;
  • оценка пользователей — 4.0, на рынке с 2019 года.

Кому подойдёт: для вспомогательной инфраструктуры вокруг модели и для экспериментов, где нужно быстро поднять пять дешёвых машин, проверить гипотезу и удалить их. Как основную площадку под большую модель 4VPS стоит рассматривать уже на старших тарифах.

Подробные характеристики и полный список тарифов — в обзоре 4VPS

7. Selectel

Selectel — российский провайдер с мощными конфигурациями серверов

Selectel — российский провайдер, работает с 2008 года, площадки в Москве и Санкт-Петербурге. В подборке у него отмечена самая мощная конфигурация, а линейка состоит из 69 тарифов с дисками трёх типов. Для компаний, которые обрабатывают персональные данные, локальное размещение — не вопрос удобства, а требование к инфраструктуре, и в такой ситуации выбор быстро сужается до нескольких российских площадок.

Цена входа — 200 ₽ в месяц, что для российского размещения немного. Стартовый тариф — 1 ядро, 1 ГБ памяти, 10 ГБ NVMe: это рабочая машина под API-обвязку, а под сам инференс придётся подниматься по линейке выше. Зато переезжать при этом никуда не нужно, а задержка до сервера из Москвы измеряется единицами миллисекунд.

  • стартовая конфигурация: 1 ядро, 1 ГБ памяти, 10 ГБ NVMe;
  • цена: от 200 ₽ / мес;
  • 69 тарифов, диски NVMe, SSD или HDD;
  • площадки: Москва, Санкт-Петербург, Россия;
  • самая мощная конфигурация среди отмеченных в подборке;
  • оценка пользователей — 4.5, на рынке с 2008 года.

Кому подойдёт: корпоративным проектам с требованием держать данные внутри страны — обработка обращений клиентов, внутренние ассистенты по документации, поиск по базе договоров.

Подробные характеристики и полный список тарифов — в обзоре Selectel

8. Timeweb

Timeweb — тарифы виртуальных серверов для размещения ИИ-сервисов

Timeweb на рынке с 2009 года, в линейке 77 тарифов, потолок — 96 ядер и 512 ГБ памяти. Это одна из немногих площадок в подборке, где рядом с NVMe и SSD доступны SAS-диски: серверные накопители, которые дешевле NVMe при большом объёме и надёжнее бытовых. Под хранение датасетов и логов запросов к модели такой вариант экономичен.

Стартовый тариф от 180 ₽ в месяц включает 15 ГБ NVMe. Комбинация «96 ядер плюс полтерабайта памяти» позволяет разместить модель на 70 миллиардов параметров в квантовании Q4 — она занимает примерно 38–42 ГБ — и обслуживать несколько параллельных сессий, оставляя запас памяти под контекст каждой из них. Площадки — Москва и Санкт-Петербург.

  • стартовый тариф включает 15 ГБ NVMe;
  • цена: от 180 ₽ / мес;
  • потолок: до 96 ядер и 512 ГБ RAM;
  • 77 тарифов, диски NVMe, SSD, SAS или HDD;
  • площадки: Москва, Санкт-Петербург, Россия;
  • оценка пользователей — 4.3, на рынке с 2009 года.

Кому подойдёт: тем, кому нужен российский дата-центр и одновременно много ядер под счёт. Разнообразие типов дисков помогает развести горячие веса и холодный архив по разным носителям без второго сервера.

Подробные характеристики и полный список тарифов — в обзоре Timeweb

9. Beget

Beget — виртуальные серверы на NVMe для небольших ИИ-сервисов

Beget работает с 2007 года и в этой подборке выделяется скорее аккуратностью, чем размахом: потолок — 8 ядер и 16 ГБ памяти, всего 7 тарифов, зато все на NVMe. Скажем прямо: держать здесь модель на 70 миллиардов параметров не получится. Зато 16 ГБ — ровно тот объём, в который комфортно помещается модель на 7B в квантовании Q4 вместе с длинным контекстом, а короткая линейка из семи тарифов избавляет от мучительного выбора.

Провайдер интересен предсказуемым биллингом и возможностью оплаты иностранной картой. Площадки — Россия, Санкт-Петербург и Казахстан. Для небольшого сервиса, где модель отвечает нескольким десяткам пользователей в день, такой машины достаточно, и переплачивать за неиспользуемые ядра не придётся.

  • стартовая конфигурация: 1 ядро, 1 ГБ памяти, 10 ГБ NVMe;
  • цена: от 330 ₽ / мес;
  • потолок: до 8 ядер и 16 ГБ RAM;
  • 7 тарифов, только NVMe-диски;
  • площадки: Россия, Санкт-Петербург, Казахстан;
  • оценка пользователей — 4.5, на рынке с 2007 года.

Кому подойдёт: небольшим сервисам и пет-проектам с моделью на 7 миллиардов параметров, а также командам, которым нужна простая понятная линейка без сотен вариантов.

Подробные характеристики и полный список тарифов — в обзоре Beget

10. Timeweb Cloud

Timeweb Cloud — облачные серверы с почасовой оплатой для нейросетей

Timeweb Cloud — единственный участник подборки, у которого прямо заявлена почасовая оплата с возможностью выключать сервер. Для ИИ-задач это меняет экономику сильнее любых характеристик. Если модель нужна два часа в сутки на обработку накопившейся очереди, вы платите за два часа, а не за календарный месяц простоя.

Стартовая конфигурация — 1 ядро, 1 ГБ памяти, 15 ГБ NVMe, от 477 ₽ в месяц; в линейке четыре тарифа. Дополнительно включена защита от DDoS-атак — полезно, когда модель отвечает через публичный API и адрес сервиса известен посторонним. Площадки есть и в России, и в Европе: Германия, Казахстан, Москва, Нидерланды, Польша, Россия, Санкт-Петербург.

  • стартовая конфигурация: 1 ядро, 1 ГБ памяти, 15 ГБ NVMe;
  • цена: от 477 ₽ / мес;
  • 4 тарифа, только NVMe-диски;
  • почасовая оплата с возможностью выключать машину;
  • защита от DDoS-атак включена, доступна оплата иностранной картой;
  • оценка пользователей — 4.5, на рынке с 2021 года.

Кому подойдёт: тем, у кого нагрузка рваная — пакетная обработка по расписанию, эксперименты с разными моделями, разовые прогоны на больших конфигурациях. Именно здесь почасовая аренда экономит больше всего.

Подробные характеристики и полный список тарифов — в обзоре Timeweb Cloud

Как выбрать: на что смотреть

Начните с размера модели. Число в названии — 7B, 13B, 70B — это количество параметров в миллиардах. Каждый параметр занимает место в памяти, и объём зависит от точности хранения. В исходном формате FP16 на параметр уходит 2 байта, то есть модель на 7 миллиардов параметров весит примерно 14 ГБ, на 13B — около 26 ГБ, на 70B — порядка 140 ГБ. Такие цифры мало кому по карману, поэтому в реальной работе почти всегда применяют квантование.

Квантование — это сжатие весов до меньшей разрядности, обычно до 4 или 5 бит на параметр. Качество ответов при переходе к 4 битам проседает незначительно, а память экономится в три-четыре раза. Ориентировочные цифры для формата Q4: 7B занимает примерно 4–5 ГБ, 13B — около 7–9 ГБ, 70B — порядка 38–42 ГБ. К этому нужно прибавить память под контекст: чем длиннее диалог или документ, тем больше уходит на кеш внимания, и на длинных контекстах это ещё несколько гигабайт.

Дальше решается главный вопрос: процессор или видеокарта. Видеопамять — VRAM — нужна, если ответ должен приходить быстро, за секунды, в интерактивном режиме. Правило простое: модель должна целиком помещаться в VRAM, иначе часть слоёв уходит в обычную память и скорость падает в разы. Под 7B в квантовании достаточно примерно 8 ГБ видеопамяти, под 13B — около 12–16 ГБ, под 70B — от 48 ГБ, то есть уже две карты или одна серверная. Аренда такой машины стоит принципиально других денег.

Процессорный вариант дешевле и во многих случаях достаточен. На CPU модель на 7B выдаёт ориентировочно от нескольких до полутора десятков токенов в секунду — это медленнее чтения вслух, но приемлемо для фоновых задач: разбора почты, классификации заявок, генерации описаний по расписанию. Здесь важны два параметра: число ядер и объём оперативной памяти. Модель должна целиком помещаться в RAM, иначе система начнёт подкачивать её с диска, и скорость упадёт до неприемлемой. Правильный ориентир при выборе тарифа — взять память вдвое больше размера квантованной модели, чтобы остался запас на контекст и на саму операционную систему. Подобрать конфигурацию под конкретный размер модели удобно на странице, где собран сервер для нейросетей с фильтрами по памяти и ядрам.

Не забудьте про диск. Веса нескольких моделей плюс кеш занимают десятки гигабайт, и стартовых 5–20 ГБ хватит ровно на одну небольшую модель. NVMe важен не для скорости генерации, а для холодного старта: чтение файла на 40 ГБ с NVMe занимает секунды, с обычного HDD — минуты. Если сервер выключается между сеансами ради экономии, эта разница ощущается каждый день.

Последнее — география. Если модель отвечает пользователям в реальном времени, каждые лишние 50 миллисекунд сетевой задержки складываются с временем генерации. Для российской аудитории площадка в Москве или Санкт-Петербурге даёт заметно более отзывчивый интерфейс, чем европейская. Для фоновой обработки задержка не важна вовсе, и тогда стоит выбирать по цене.

Сколько это стоит

Порог входа в подборке разошёлся почти шестикратно: от 110 ₽ в месяц у 4VPS до 608 ₽ у ishosting. Но сравнивать стартовые цены напрямую бессмысленно — за ними стоят разные конфигурации. У 4VPS за 110 ₽ дают 5 ГБ диска, у Aéza за 593 ₽ — 2 ГБ памяти и 30 ГБ NVMe. Средний порог по десяти провайдерам — около 359 ₽ в месяц, и это цена машины, на которой можно развернуть окружение, но не запустить языковую модель.

Реальный бюджет считается от конфигурации. Для модели на 7B в квантовании нужно ориентироваться на 8–16 ГБ памяти и 4 ядра — это средний сегмент линейки, обычно в несколько раз дороже стартового тарифа. Для 13B понадобится 16–32 ГБ, для 70B на процессоре — от 64 ГБ памяти, и такие тарифы есть далеко не у всех: по потолкам подходят Aéza с 1024 ГБ, ishosting с 1152 ГБ, Fornex и Timeweb с 512 ГБ, AdminVPS с 256 ГБ.

Переплата чаще всего возникает в двух местах. Первое — округление вверх: взяли тариф на 64 ГБ, потому что на 48 ГБ у провайдера нет. Здесь выручают провайдеры с плотной сеткой — 668 тарифов у ishosting, 568 у 4VPS, 174 у Fornex. Второе — оплата простоя: если модель работает по расписанию несколько часов в сутки, помесячный тариф означает, что вы платите за круглосуточную аренду при загрузке в 10%.

Отсюда простая арифметика почасовой аренды. Разделите месячную цену тарифа на 720 — примерное число часов в месяце — и получите стоимость часа. Умножьте на реальное число часов работы: при трёх часах в сутки это 90 часов, то есть примерно восьмая часть месяца. Даже вдвое более дорогой тариф с почасовой оплатой и возможностью выключения в таком режиме обойдётся дешевле помесячного. Если же сервер работает круглосуточно, помесячная оплата почти всегда выгоднее.

Нужна ли видеокарта для запуска модели на 7B?

Не обязательно. Модель на 7 миллиардов параметров в квантовании Q4 занимает примерно 4–5 ГБ и запускается на обычном процессорном сервере с 8–16 ГБ оперативной памяти. Скорость составит ориентировочно единицы или первые десятки токенов в секунду — этого достаточно для фоновых задач.

Видеокарта нужна, когда ответ должен приходить за секунду-две в живом диалоге или когда одновременно обслуживаются десятки пользователей. Тогда модель должна целиком помещаться в видеопамять: под 7B хватит примерно 8 ГБ VRAM.

Сколько памяти нужно под модель на 70B?

В квантовании до 4 бит веса модели на 70 миллиардов параметров занимают ориентировочно 38–42 ГБ. С учётом контекста и системы разумный минимум оперативной памяти — 64 ГБ, комфортный — 96–128 ГБ. Такие конфигурации в подборке доступны у Aéza, ishosting, Fornex, Timeweb и AdminVPS.

Если запускать 70B без квантования, в формате FP16, потребуется порядка 140 ГБ только под веса. На процессоре это возможно на машинах с 256 ГБ и выше, но скорость будет измеряться секундами на токен, и практический смысл такого запуска ограничен единичными задачами.

Что быстрее: много ядер или высокая частота?

Для инференса на процессоре важнее число ядер и пропускная способность памяти. Генерация токенов распараллеливается по потокам, и переход с 4 ядер на 16 даёт заметный прирост. Но линейного роста ждать не стоит: начиная с определённого момента упирается память, а не вычисления, и добавление ядер перестаёт помогать.

Практический ориентир — 4–8 ядер под одного пользователя и модель на 7–13B. Конфигурации на 40, 96 и 128 ядер имеют смысл при батчевой обработке, когда одновременно считаются десятки запросов.

Можно ли обучать модель на обычном VPS?

Полноценное обучение с нуля на процессорном сервере нереально — задача требует кластера видеокарт и недель работы. А вот дообучение методом LoRA, когда обновляется небольшая часть весов, на CPU технически выполнимо для моделей до 7B, хотя займёт часы или сутки вместо минут на видеокарте.

Практичный сценарий — арендовать мощную конфигурацию на время дообучения, а потом перейти на скромный тариф для инференса. Провайдеры с плотной тарифной сеткой позволяют менять конфигурацию, не переезжая на другую площадку.

Что такое квантование и теряется ли качество?

Квантование — это уменьшение точности хранения весов: вместо 16 бит на параметр используется 8, 5 или 4. Файл модели сжимается в два-четыре раза, требования к памяти падают пропорционально, скорость обычно растёт.

Качество при переходе к 8 и 5 битам меняется незаметно для большинства задач. На 4 битах разница появляется в сложных рассуждениях и работе с кодом, но для суммаризации, классификации и извлечения данных из текста она почти не заметна. Ниже 4 бит опускаться обычно не стоит.

Где размещать сервер, если пользователи в России?

Если модель отвечает в интерактивном режиме, выбирайте площадку в Москве или Санкт-Петербурге: такие локации есть у Selectel, Timeweb, Beget, Timeweb Cloud, AdminVPS и Aéza. Сетевая задержка внутри страны обычно измеряется единицами миллисекунд против десятков при европейском размещении.

Для фоновой обработки, когда результат нужен через минуты или к утру, география не влияет на пользовательский опыт. В этом случае имеет смысл смотреть на цену и на потолок конфигураций, а не на расстояние до дата-центра.

Как посчитать, что выгоднее — почасовая или помесячная оплата?

Возьмите месячную цену тарифа, разделите на 720 часов и получите цену часа при непрерывной работе. Затем оцените, сколько часов в месяц сервер реально нужен: три часа в сутки — это 90 часов, восемь часов — 240.

Если загрузка меньше трети месяца, почасовая аренда с выключением машины почти всегда дешевле, даже если ставка за час выше. При круглосуточной работе выгоднее помесячный тариф. В подборке возможность выключать сервер с почасовым биллингом заявлена у Timeweb Cloud.

Итог

Выбор сводится к трём числам: размер модели в параметрах, объём памяти после квантования и число часов работы в месяц. Посчитайте их до того, как открывать тарифы, — и половина вариантов отсеется сама. Под модель на 7B хватит машины с 16 ГБ памяти и четырьмя ядрами, под 13B нужно вдвое больше, под 70B — от 64 ГБ и провайдер с высоким потолком конфигураций.

Из подборки по потолкам памяти выделяются ishosting и Aéza, по числу ядер — AdminVPS, по гибкости оплаты — Timeweb Cloud, по цене входа — 4VPS, по российскому размещению — Selectel, Timeweb и Beget. Сравнить конфигурации и цены всех участников в одном месте можно там, где собран сервер для нейросетей с фильтрами по памяти, ядрам и локации.

Оцените статью
Xiaomi: обзоры продуктов и советы
Добавить комментарии