30 миллиардов: на плате или на платах?
Вы покупаете одну плату — и получаете рабочий ИИ на малых моделях. Докупаете вторую — и вместе они несут модель класса 30B, которая ни в одну из них не помещалась. Качественный скачок за цену платы, без замены того, что уже куплено.
ПопробоватьДля кого. Тем, кому нужны сложные ответы на своём железе: аналитика, разбор документов, рассуждения — без передачи данных наружу
Что забирает. Снимает главный предрассудок про edge-ИИ — «на плате живут только маленькие модели». Вот большая, вот она отвечает, вот измеренные секунды
Как попробовать. Задайте вопрос посложнее — из тех, на которых малые модели плавают. Ответ займёт около минуты: модель большая, плата маленькая, и это честная цена точности
Спросите плату — или пару
Оба контура ниже — одна и та же модель Qwen3-30B-A3B (MoE: из 30 миллиардов параметров на каждый токен работают около трёх). «Пара» — две платы как одна модель: веса разрезаны пополам, платы связаны обычным гигабитным кабелем, отвечает сразу. «Одна плата» несёт все 19 ГБ весов в одиночку и держит их в памяти только пока нужна: после переключения модель поднимается около двух минут — витрина покажет прогрев, это честная цена ленивой загрузки. Стенд экспериментальный: при редком совпадении нагрузок ответ может оборваться — просто спросите ещё раз.
Ответ появится здесь; под ним — время, скорость, энергия и куда ушли данные.
Демо ограничено: 20 запусков в час с одного адреса и 800 символов на вопрос. Первый запрос к незагруженной модели дольше остальных — это видно в строке «прогрев». Загрузка, нагрев и потребление стенда видны прямо на кнопке выбора железа; наведите на шкалы, чтобы увидеть числа. Потребление измеряется только у видеокарты, у платы датчика тока нет. Облачный контур отправляет вопрос внешнему провайдеру — это видно и в метриках после ответа.
Эксперимент: та же модель на паре плат
Мы соединили две платы обычным гигабитным кабелем и разрезали модель пополам — каждой плате по половине весов. Вот измеренное (и да, после настройки потоков под big.LITTLE пара стала ещё в полтора раза быстрее — витрина живёт, цифры обновляются).
| Одна плата CM3588 (32 ГБ) | 5,8 токена/с | модель целиком в памяти одной платы |
| Пара: CM3588 + Repka Pi 5 | 7,6 токена/с | +30% от второй платы; синхронизация по сети — 44 мс на токен |
| Память пары | 9,6 + 8,4 ГБ | половинки помещаются в две платы по 16 ГБ — например, в две Repka Pi 5 |
Эта таблица — уже не план, а два работающих контура: обе строки можно проверить кнопками выше, и соло, и пару. Модель, которая не помещается в малую плату вовсе, работает на двух малых платах — и быстрее, чем на одной большой. Рост покупается добавлением платы, а не заменой железа.
Что это даёт бизнесу
Апгрейд без свалки железа: каждая купленная плата остаётся в строю. Большая модель перестаёт означать «сервер с видеокартой» или «облако» — это ещё одна плата за десятки тысяч рублей, и данные по-прежнему не покидают ваш периметр.
На чём это работает
- Пара плат — CM3588 Plus (корень, 9,5 ГБ весов) + Repka Pi 5 (воркер, 8,4 ГБ), связаны гигабитным Ethernet — для модели это одна машина
- Одна плата — FriendlyElec CM3588 Plus: Rockchip RK3588 (4×Cortex-A76 до 2,4 ГГц + 4×Cortex-A55 1,8 ГГц), 32 ГБ LPDDR5, 4 слота M.2 NVMe (PCIe 3.0 ×1), накопители 3 × Intel Optane
Подробные паспорта стендов, их загрузка и потребление — на странице Стенды.
Хотите такое у себя?
Посчитаем лестницу под вашу задачу: с какой платы начать, что она закроет сразу и в какой момент докупить вторую — с ценами каждой ступени и без покупок «на вырост»
Нашли неточность или есть предложение по витрине? .