Стенды лаборатории
Это железо нашей лаборатории — оно прямо сейчас считает демо витрины. Такие же комплекты мы собираем заказчикам: здесь видно, как они держат нагрузку и сколько стоят. Облако рядом — контур сравнения: его запросы уходят внешним провайдерам, и в метриках это всегда видно.
Edge-контур: автономная работа, интернет не требуется
на связи
На этой машине 3 вычислителя, и витрина сравнивает их между собой: процессор, нейроускоритель, ускоритель AX650N.
Железо
FriendlyElec CM3588 Plus: Rockchip RK3588 (4×Cortex-A76 до 2,4 ГГц + 4×Cortex-A55 1,8 ГГц), 32 ГБ LPDDR5, 4 слота M.2 NVMe (PCIe 3.0 ×1), накопители 3 × Intel Optane
процессор — CPU-кластер RK3588: 4×Cortex-A76 до 2,4 ГГц + 4×Cortex-A55 1,8 ГГц
нейроускоритель — NPU RK3588: 3 ядра, 6 TOPS (INT8), встроен в SoC
ускоритель AX650N — Axera AX650N: NPU 18 TOPS (INT8) / 72 TOPS (INT4), 8 ГБ LPDDR4x на модуле; октоядерный Cortex-A55
Такой комплект целиком — около 65 000 ₽: плата с 32 ГБ памяти, ускоритель AX650N и корпус (цены июля 2026, как в разделе «Экономика»)
Модели
процессор — Qwen3.5-4B · GGUF Q8_0 · llama.cpp (Ollama) 4,7 млрд параметров · паспортный контекст 256K qwen3.5:4b-q8_0
нейроускоритель — Qwen3.5-4B · W8A8 · RKLLM 4 млрд параметров · рабочий контекст 4K (настройка стенда) qwen3.5-4b_w8a8_rk3588
ускоритель AX650N — Qwen3.5-4B · GPTQ Int4 · AXCL 4 млрд параметров · рабочий контекст 2K (лимит сборки) AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C128-P1152-CTX2047
Где стоит
Локальная сеть; одноплатный модуль на несущей плате NAS-формата
Потребление под полной нагрузкой: до 20 Вт (оценка — датчика тока на плате нет)
≈80 ₽ электричества в месяц при круглосуточной полной нагрузке (тариф 5,5 ₽/кВт·ч)
Кому подходит
Там, где нет связи и данные не должны покидать объект.
Здесь работают: Один вопрос — пять ответов, Куда уходят ваши данные, ИИ-редактор сайта, Голосовой помощник у станка, Сколько это стоит на самом деле
Основной стенд — локальные модели и RAG с графом знаний
на связи
Железо
гипервизор Proxmox VE: Xeon E5-2696 v2, 32 vCPU, 121 ГБ RAM; GPU передана в гостевую ВМ через PCIe passthrough (VFIO)
Сервер такого класса — около 180 000 ₽ (видеокарта с вторичного рынка, цены июля 2026, как в разделе «Экономика»)
Для сравнения в рознице (август 2026): новая карта с теми же 24 ГБ памяти — только RTX 4090, от ~140 000 ₽ за одну карту; RTX 5060 Ti 16 ГБ стоит ~60 000 ₽ (DNS, Ситилинк), но памяти на треть меньше — большие модели уже не поместятся. Поэтому 3090 с вторичного рынка — самый дешёвый вход в класс 24 ГБ
Модели
Qwen3.5-9B · GGUF Q4_K_M · llama.cpp (Ollama) 9,7 млрд параметров · паспортный контекст 256K qwen3.5:9b
Где стоит
Серверная; гостевая ВМ Proxmox VE
Потребление под полной нагрузкой: до 350 Вт (паспортный предел; под нагрузкой замерено 320 Вт)
≈1 270 ₽ электричества в месяц при круглосуточной полной нагрузке (тариф 5,5 ₽/кВт·ч)
Кому подходит
Корпоративный контур: своё железо, данные внутри периметра.
Здесь работают: Один вопрос — пять ответов, Ответы по вашим документам — с цитатой до страницы, Проверка документа по чек-листу, Запрос к базе на русском, Куда уходят ваши данные, ИИ-редактор сайта, Голосовой помощник у станка, Сколько это стоит на самом деле
Хостинг-плата: отдаёт вам этот сайт прямо сейчас
работает — эта страница отдана им
Живую загрузку хостинга не публикуем намеренно: узел смотрит в интернет, и его телеметрия стала бы обратной связью для атакующего. Загрузка вычислительных стендов открыта — они наружу не выведены.
Внутри два вычислителя: процессор отдаёт сайт, а нейроускоритель дежурит резервом NPU-стенда витрины.
Железо
FriendlyElec NanoPi M6: Rockchip RK3588S (4×Cortex-A76 до 2,4 ГГц + 4×Cortex-A55), 32 ГБ LPDDR5, NVMe-накопитель; Armbian, вендорное ядро 6.1
нейроускоритель — NPU RK3588S: 3 ядра, 6 TOPS (INT8), встроен в SoC
Модели
нейроускоритель — Qwen3.5-4B · W8A8 · RKLLM 4 млрд параметров · рабочий контекст 4K (настройка стенда) qwen3.5-4b_w8a8_rk3588
Где стоит
Локальная сеть; металлический корпус размером с ладонь
Потребление под полной нагрузкой: до 10 Вт (оценка — датчика тока нет)
≈40 ₽ электричества в месяц при круглосуточной работе (тариф 5,5 ₽/кВт·ч)
Кому подходит
Вариант поставки: такая же коробка размером с ладонь хостит ваш сайт вместе с ИИ-редактором — целиком в вашем офисе.
Контур сравнения — максимальное качество за деньги
на связи
Железо
шлюз Ollama: в демо kimi-k2.6; подключаются Qwen, OpenAI, Anthropic и другие
Модели
kimi-k2.6 · исполняется у провайдера (Ollama Cloud) ~1 трлн параметров (MoE) · Int4 · контекст 256K kimi-k2.6:cloud
Где стоит
Инфраструктура провайдера, вне периметра компании
Кому подходит
Когда нужна максимальная модель и данные не чувствительны.
Здесь работают: Один вопрос — пять ответов, Запрос к базе на русском, Куда уходят ваши данные, ИИ-редактор сайта, Сколько это стоит на самом деле
Как витрина остаётся живой под нагрузкой
Эти же механизмы мы ставим заказчикам: публичный ИИ-сервис без них либо ложится под нагрузкой, либо разоряет владельца. Открытые демо — наше ежедневное упражнение в эксплуатации, вот как оно устроено.
- Очередь вместо отказа. У локальных вычислителей один-два слота — это физика ускорителей. Занятый стенд ставит запрос в очередь и говорит «вы следующий», а витрина предлагает свободный контур: затор превращается в повод сравнить железо.
- Пик принимает резерв. У главных вычислителей есть двойники на соседних машинах: вторая RTX 3090 и второй NPU на плате, которая отдаёт этот сайт. Оба слота основного заняты — запрос уезжает на резерв, и посетитель не ждёт в очереди. Модель та же, а в метриках честная пометка, чьё железо считало.
- Бюджеты по стоимости ресурса. Облачные запросы считаются в рублях и ограничены дневным бюджетом — общим и личным на посетителя. Своё железо деньгами не лимитируется: оно уже оплачено, его берегут очередь и часовые квоты.
- Лимиты дышат. Квота придумана для конкуренции за железо: пока витриной пользуется один посетитель, ему можно в несколько раз больше; появился второй — квота сжимается до обычной. Деньги облака под постоянным лимитом всегда.
- Сканеры отсекаются до приложения. Автоматика, которая ищет уязвимости, получает отказ на пороге. А вот ИИ-агенты — желанные гости: агент, изучающий подрядчика по поручению клиента, уходит отсюда с цифрами (для него есть llms.txt).
- Даже сама витрина — edge. Страницы, очереди и журналы обслуживает не сервер, а вторая плата: NanoPi M6 на том же поколении чипа (RK3588S, 32 ГБ). Сайт, который вы читаете, отдаёт компьютер размером с ладонь.
- Гид знает обстановку. Ассистент видит состояние стендов и очереди — если нужный контур занят, он скажет об этом прямо и предложит свободный.
- Путь сессии записывается — и мы говорим об этом. Открытые страницы и запуски демо хранятся месяц под обезличенной меткой: по ним ассистент ведёт дальше, а мы готовим консультацию, если вы оставите заявку. IP и отпечатки браузера в журнал не пишутся; подробности — в политике обработки данных на основном сайте.
Примерьте на себя
Нагрузим любой из этих стендов вашей задачей — и вы увидите те же честные цифры, но про свой процесс.