Стенды лаборатории
Это железо нашей лаборатории — оно прямо сейчас считает демо витрины. Такие же комплекты мы собираем заказчикам: здесь видно, как они держат нагрузку и сколько стоят. Облако рядом — контур сравнения: его запросы уходят внешним провайдерам, и в метриках это всегда видно.
Российский edge-контур: тот же чип, что у CM3588, — сравните две платы на одном вопросе
на связи
На этой машине 2 вычислителя, и витрина сравнивает их между собой: процессор, нейроускоритель.
Железо
Repka Pi 5: Rockchip RK3588 (4×Cortex-A76 2,26 ГГц + 4×Cortex-A55 1,8 ГГц), 16 ГБ LPDDR4X, модуль eMMC 64 ГБ; российская плата в форм-факторе Raspberry Pi 5
процессор — CPU-кластер RK3588: 4×Cortex-A76 2,26 ГГц + 4×Cortex-A55 1,8 ГГц
нейроускоритель — NPU RK3588: 3 ядра, 6 TOPS (INT8), встроен в SoC
Плата с 16 ГБ — 33 900 ₽ по прайсу производителя (август 2026)
Модели
процессор — Qwen3.5-4B · GGUF Q8_0 · llama.cpp (Ollama) 4,7 млрд параметров · паспортный контекст 256K qwen3.5:4b-q8_0
нейроускоритель — Qwen3.5-4B · W8A8 · RKLLM 4 млрд параметров · рабочий контекст 4K (настройка стенда) qwen3.5-4b_w8a8_rk3588
Где стоит
Лаборатория; плату передал производитель — работаем с командой Repka Pi напрямую · сайт производителя · наш кейс в блоге производителя
Кому подходит
Встраивается куда угодно: плата размером с банковскую карту (85 × 56 мм) и весом 58 граммов встанет в шкаф автоматики, терминал или корпус станка. Для заказчиков с требованием реестра Минпромторга: у производителя там Repka Pi 3 и Pi 4 Optimal; новая Pi 5 пока не внесена. Модели и замеры — те же, что на остальной витрине: наш стек завёлся без переделок — плата отвечала посетителям уже на следующий день после получения.
Здесь работают: Один вопрос — восемь ответов, Куда уходят ваши данные, Консилиум, ИИ-редактор сайта, Голосовой помощник у станка, Сообщение сквозь голосовой канал
Edge-контур: автономная работа, интернет не требуется
на связи
На этой машине 3 вычислителя, и витрина сравнивает их между собой: процессор, нейроускоритель, ускоритель AX650N.
Железо
FriendlyElec CM3588 Plus: Rockchip RK3588 (4×Cortex-A76 до 2,4 ГГц + 4×Cortex-A55 1,8 ГГц), 32 ГБ LPDDR5, 4 слота M.2 NVMe (PCIe 3.0 ×1), накопители 3 × Intel Optane
процессор — CPU-кластер RK3588: 4×Cortex-A76 до 2,4 ГГц + 4×Cortex-A55 1,8 ГГц
нейроускоритель — NPU RK3588: 3 ядра, 6 TOPS (INT8), встроен в SoC
процессор · 30B — та же модель целиком на одной плате: 18 ГБ весов в памяти CM3588 (32 ГБ) — замер по занятости платы: 11 ГБ холодная, 29 ГБ с моделью; поднимается первым запросом за пару минут и выгружается по простою
ускоритель AX650N — Axera AX650N: NPU 18 TOPS (INT8) / 72 TOPS (INT4), 8 ГБ LPDDR4x на модуле; восьмиядерный Cortex-A55
Такой комплект целиком — около 65 000 ₽: плата с 32 ГБ памяти, ускоритель AX650N и корпус (цены июля 2026, как в разделе «Экономика»)
Модели
процессор — Qwen3.5-4B · GGUF Q8_0 · llama.cpp (Ollama) 4,7 млрд параметров · паспортный контекст 256K qwen3.5:4b-q8_0
нейроускоритель — Qwen3.5-4B · W8A8 · RKLLM 4 млрд параметров · рабочий контекст 4K (настройка стенда) qwen3.5-4b_w8a8_rk3588
процессор · 30B — Qwen3-30B-A3B · MoE · целиком на одной плате · distributed-llama 30 млрд параметров (MoE, ~3 млрд активных на токен) — для соло нужна плата с 32 ГБ памяти qwen3-30b-a3b-solo
ускоритель AX650N — Qwen3-VL-4B 4 млрд параметров · рабочий контекст ≈1,2K токенов (замер 06.09.2026: 1 200 проходят, 1 290 — отказ сборки; 07.09.2026 промптом агента: 2 727 знаков = 1 230 токенов проходят, 3 004 знака — отказ «контекст превышен») AXERA-TECH/Qwen3-VL-4B-Instruct-GPTQ-Int4
Где стоит
Локальная сеть; одноплатный модуль на несущей плате NAS-формата
Потребление под полной нагрузкой: до 20 Вт (оценка — датчика тока на плате нет)
≈80 ₽ электричества в месяц при круглосуточной полной нагрузке (тариф 5,5 ₽/кВт·ч)
Кому подходит
Там, где нет связи и данные не должны покидать объект.
Здесь работают: Один вопрос — восемь ответов, 30 миллиардов: на плате или на платах?, Куда уходят ваши данные, Консилиум, ИИ-редактор сайта, Голосовой помощник у станка, Сообщение сквозь голосовой канал, Помощник по документам целиком на одной плате: читает, запоминает, отвечает, Сколько это стоит на самом деле
Живой пример роста платами: докупили вторую — получили модель классом выше и в полтора раза быстрее соло
на связи
Железо
CM3588 Plus (корень, 9,5 ГБ весов) + Repka Pi 5 (воркер, 8,4 ГБ) в общей гигабитной сети — для модели это одна машина
Модели
Qwen3-30B-A3B · MoE · распределена на две платы · distributed-llama 30 млрд параметров (MoE, ~3 млрд активных на токен) — класс моделей, который в одну малую плату не помещается вовсе qwen3-30b-a3b-q40
Где стоит
Лаборатория: обе платы в общей локальной сети, отдельного соединения между ними нет
Кому подходит
Апгрейд без свалки железа: большая модель — это ещё одна плата за десятки тысяч рублей, а не сервер с видеокартой. Данные не покидают периметр.
Здесь работают: 30 миллиардов: на плате или на платах?
Основной стенд — локальные модели и RAG с графом знаний
на связи
Железо
гипервизор Proxmox VE: Xeon E5-2696 v2, 32 vCPU, 121 ГБ RAM; GPU передана в гостевую ВМ через PCIe passthrough (VFIO)
Сервер такого класса — около 180 000 ₽ (видеокарта со вторичного рынка, цены июля 2026, как в разделе «Экономика»)
Для сравнения в рознице (август 2026): новая карта с теми же 24 ГБ памяти — только RTX 4090, от ~140 000 ₽ за одну карту; RTX 5060 Ti 16 ГБ стоит ~60 000 ₽ (DNS, Ситилинк), но памяти на треть меньше — большие модели уже не поместятся. Поэтому 3090 со вторичного рынка — самый дешёвый вход в класс 24 ГБ
Модели
Qwen3.5-9B · GGUF Q4_K_M · llama.cpp (Ollama) 9,7 млрд параметров · паспортный контекст 256K qwen3.5:9b
Где стоит
Серверная; гостевая ВМ Proxmox VE
Потребление под полной нагрузкой: до 350 Вт (паспортный предел; под нагрузкой замерено 320 Вт)
≈1 270 ₽ электричества в месяц при круглосуточной полной нагрузке (тариф 5,5 ₽/кВт·ч)
Кому подходит
Корпоративный контур: своё железо, данные внутри периметра.
Здесь работают: Один вопрос — восемь ответов, Ответы по вашим документам — с цитатами и указанием страниц, Проверка документа по чек-листу, Запрос к базе на русском, Куда уходят ваши данные, Консилиум, ИИ-редактор сайта, Голосовой помощник у станка, Сколько это стоит на самом деле
Хостинг-плата: отдаёт вам этот сайт прямо сейчас
работает — эта страница отдана им
Живую загрузку хостинга не публикуем намеренно: узел смотрит в интернет, и его телеметрия стала бы обратной связью для атакующего. Загрузка вычислительных стендов открыта — они наружу не выведены.
Внутри два вычислителя: процессор отдаёт сайт, а нейроускоритель дежурит резервом NPU-стенда витрины.
Железо
FriendlyElec NanoPi M6: Rockchip RK3588S (4×Cortex-A76 до 2,4 ГГц + 4×Cortex-A55), 32 ГБ LPDDR5, NVMe-накопитель; Armbian, вендорное ядро 6.1
процессор — CPU-кластер RK3588S: 4×Cortex-A76 до 2,4 ГГц + 4×Cortex-A55
нейроускоритель — NPU RK3588S: 3 ядра, 6 TOPS (INT8), встроен в SoC
Модели
нейроускоритель — Qwen3.5-4B · W8A8 · RKLLM 4 млрд параметров · рабочий контекст 4K (настройка стенда) qwen3.5-4b_w8a8_rk3588
Где стоит
Локальная сеть; металлический корпус размером с ладонь
Потребление под полной нагрузкой: до 10 Вт (оценка — датчика тока нет)
≈40 ₽ электричества в месяц при круглосуточной работе (тариф 5,5 ₽/кВт·ч)
Кому подходит
Вариант поставки: такая же коробка размером с ладонь хостит ваш сайт вместе с ИИ-редактором — целиком в вашем офисе.
Контур сравнения — максимальное качество за деньги
на связи
На этой машине 2 вычислителя, и витрина сравнивает их между собой: Moonshot, Яндекс.
Железо
два канала: API Moonshot (kimi-k2.6) и API Яндекса (Alice AI); подключаются Qwen, OpenAI, Anthropic и другие
Moonshot — Собственного железа нет: запросы уходят вычислителям провайдера напрямую по API
Яндекс — Собственного железа нет: запросы уходят в дата-центры Яндекса по OpenAI-совместимому API
Модели
Moonshot — kimi-k2.6 · исполняется у провайдера (Moonshot AI) ~1 трлн параметров (MoE, ~32 млрд активных на токен) · контекст 256K
Яндекс — Alice AI · исполняется в облаке Яндекса (AI Studio) размер моделей Яндекс не публикует; работает только с текстом aliceai-llm-flash
Где стоит
Инфраструктура провайдера, вне периметра компании
Кому подходит
Когда нужна максимальная модель и данные не чувствительны.
Здесь работают: Один вопрос — восемь ответов, Запрос к базе на русском, Куда уходят ваши данные, ИИ-редактор сайта, Помощник в облаке, Сколько это стоит на самом деле
Как витрина остаётся живой под нагрузкой
Эти же механизмы мы ставим заказчикам: публичный ИИ-сервис без них либо ложится под нагрузкой, либо разоряет владельца. Открытые демо — наше ежедневное упражнение в эксплуатации, вот как оно устроено.
- Очередь вместо отказа. У локальных вычислителей один-два слота — это физика ускорителей. Занятый стенд ставит запрос в очередь и говорит «вы следующий», а витрина предлагает свободный контур: затор превращается в повод сравнить железо.
- Пик принимает резерв. У главных вычислителей есть двойники на соседних машинах: вторая RTX 3090 и второй NPU на плате, которая отдаёт этот сайт. Оба слота основного заняты — запрос уезжает на резерв, и посетитель не ждёт в очереди. Модель та же, а в метриках честная пометка, чьё железо считало.
- Бюджеты по стоимости ресурса. Облачные запросы считаются в рублях и ограничены дневным бюджетом — общим и личным на посетителя. Своё железо деньгами не лимитируется: оно уже оплачено, его берегут очередь и часовые квоты.
- Лимиты дышат. Квота придумана для конкуренции за железо: пока витриной пользуется один посетитель, ему можно в несколько раз больше; появился второй — квота сжимается до обычной. Деньги облака под постоянным лимитом всегда.
- Сканеры отсекаются до приложения. Автоматика, которая ищет уязвимости, получает отказ на пороге. А вот ИИ-агенты — желанные гости: агент, изучающий подрядчика по поручению клиента, уходит отсюда с цифрами (для него есть llms.txt).
- Даже сама витрина — edge. Страницы, очереди и журналы обслуживает не сервер, а вторая плата: NanoPi M6 на том же поколении чипа (RK3588S, 32 ГБ). Сайт, который вы читаете, отдаёт компьютер размером с ладонь.
- Гид знает обстановку. Ассистент видит состояние стендов и очереди — если нужный контур занят, он скажет об этом прямо и предложит свободный.
- Путь сессии записывается — и мы говорим об этом. Открытые страницы и запуски демо хранятся месяц под обезличенной меткой: по ним ассистент ведёт дальше, а мы готовим консультацию, если вы оставите заявку. IP и отпечатки браузера в журнал не пишутся; подробности — в политике обработки данных на основном сайте.
Примерьте на себя
Нагрузим любой из этих стендов вашей задачей — и вы увидите те же честные цифры, но про свой процесс.