Один вопрос — три ответа
Задайте вопрос и сравните ответы edge-платы, RTX 3090 и облака
ПопробоватьКому и зачем
Наглядно видно, за что вы платите: скорость, качество или приватность
На чём работает
br-01 · RTX 3090
NVIDIA RTX 3090 24 ГБ, Xeon E5-2696 v2 (32 потока), 121 ГБ RAM
Основной стенд — локальные LLM, RAG, граф знаний
на связи
Облачные модели
Внешние провайдеры — Kimi, Qwen, MiniMax, OpenAI, Anthropic, Yandex, GigaChat
Контур сравнения — максимальное качество за деньги
на связи
CM3588 Plus
RK3588 (4×A76 + 4×A55), 32 ГБ, NPU 6 TOPS + AX650N 24 TOPS INT8 по PCIe
Edge-контур — работает автономно, без интернета
выключен
Ограничения демо: ответ ограничен 500 токенами — демо показывает скорость и цену, а не длину текста
Что видно во время работы
- ответы разных контуров рядом, на одном вопросе
- Измеряем: время до первого слова, скорость ответа, объём ответа, стоимость запроса, какая модель отвечала, на каком железе считали, покидали ли данные периметр
Задайте вопрос и сравните контуры
Один и тот же вопрос можно прогнать на разном железе. Под ответом — измеренные цифры этого запуска, а не средние по рынку.
Демо ограничено: 20 запусков в час с одного адреса и 800 символов на вопрос. Первый запрос к незагруженной модели дольше остальных — это видно в строке «прогрев».
Хотите такое у себя?
Обсудим вашу задачу и подберём конфигурацию.