Чат

30 миллиардов: на плате или на платах?

Вы покупаете одну плату — и получаете рабочий ИИ на малых моделях. Докупаете вторую — и вместе они несут модель класса 30B, которая ни в одну из них не помещалась. Качественный скачок за цену платы, без замены того, что уже куплено.

Попробовать

Для кого. Тем, кому нужны сложные ответы на своём железе: аналитика, разбор документов, рассуждения — без передачи данных наружу

Что забирает. Снимает главный предрассудок про edge-ИИ — «на плате живут только маленькие модели». Вот большая, вот она отвечает, вот измеренные секунды

Как попробовать. Задайте вопрос посложнее — из тех, на которых малые модели плавают. Ответ займёт около минуты: модель большая, плата маленькая, и это честная цена точности

Живое демо

Спросите плату — или пару

Оба контура ниже — одна и та же модель Qwen3-30B-A3B (MoE: из 30 миллиардов параметров на каждый токен работают около трёх). «Пара» — две платы как одна модель: веса разрезаны пополам, платы связаны обычным гигабитным кабелем, отвечает сразу. «Одна плата» несёт все 19 ГБ весов в одиночку и держит их в памяти только пока нужна: после переключения модель поднимается около двух минут — витрина покажет прогрев, это честная цена ленивой загрузки. Стенд экспериментальный: при редком совпадении нагрузок ответ может оборваться — просто спросите ещё раз.

Пара плат
Одна плата

Ответ появится здесь; под ним — время, скорость, энергия и куда ушли данные.

Демо ограничено: 20 запусков в час с одного адреса и 800 символов на вопрос. Первый запрос к незагруженной модели дольше остальных — это видно в строке «прогрев». Загрузка, нагрев и потребление стенда видны прямо на кнопке выбора железа; наведите на шкалы, чтобы увидеть числа. Потребление измеряется только у видеокарты, у платы датчика тока нет. Облачный контур отправляет вопрос внешнему провайдеру — это видно и в метриках после ответа.

Эксперимент

Эксперимент: та же модель на паре плат

Мы соединили две платы обычным гигабитным кабелем и разрезали модель пополам — каждой плате по половине весов. Вот измеренное (и да, после настройки потоков под big.LITTLE пара стала ещё в полтора раза быстрее — витрина живёт, цифры обновляются).

Одна плата CM3588 (32 ГБ)5,8 токена/смодель целиком в памяти одной платы
Пара: CM3588 + Repka Pi 57,6 токена/с+30% от второй платы; синхронизация по сети — 44 мс на токен
Память пары9,6 + 8,4 ГБполовинки помещаются в две платы по 16 ГБ — например, в две Repka Pi 5

Эта таблица — уже не план, а два работающих контура: обе строки можно проверить кнопками выше, и соло, и пару. Модель, которая не помещается в малую плату вовсе, работает на двух малых платах — и быстрее, чем на одной большой. Рост покупается добавлением платы, а не заменой железа.

01 · Кому и зачем

Что это даёт бизнесу

Апгрейд без свалки железа: каждая купленная плата остаётся в строю. Большая модель перестаёт означать «сервер с видеокартой» или «облако» — это ещё одна плата за десятки тысяч рублей, и данные по-прежнему не покидают ваш периметр.

02 · Железо

На чём это работает

  • Пара плат — CM3588 Plus (корень, 9,5 ГБ весов) + Repka Pi 5 (воркер, 8,4 ГБ), связаны гигабитным Ethernet — для модели это одна машина
  • Одна плата — FriendlyElec CM3588 Plus: Rockchip RK3588 (4×Cortex-A76 до 2,4 ГГц + 4×Cortex-A55 1,8 ГГц), 32 ГБ LPDDR5, 4 слота M.2 NVMe (PCIe 3.0 ×1), накопители 3 × Intel Optane

Подробные паспорта стендов, их загрузка и потребление — на странице Стенды.

03 · Дальше

Хотите такое у себя?

Посчитаем лестницу под вашу задачу: с какой платы начать, что она закроет сразу и в какой момент докупить вторую — с ценами каждой ступени и без покупок «на вырост»

Нашли неточность или есть предложение по витрине? .

Проводник по лаборатории отвечает облачная модель — вопросы уходят провайдеру
Я проводник по лаборатории. Расскажите своими словами, что за задача — подскажу, какое демо посмотреть и что оно вам даст. Или начните с готового вопроса.

С чего начать: