Сколько стоит развернуть LLM в своём контуре? ⌨️

Когда показываем платформу нефтегазовым компаниям, почти всегда первым делом спрашивают одно и то же. Как поставить всё это у себя, какое железо понадобится и во сколько обойдётся. Данные наружу никто выпускать не хочет, поэтому рано или поздно разговор упирается в сервер.

Самый простой вариант на сегодня – это NVIDIA DGX Spark. Небольшая коробка 15 на 15 см, 128 ГБ общей памяти, обычная розетка и цена $4699 в США. Две такие машины можно соединить напрямую кабелем, без отдельного коммутатора, и получить 256 ГБ памяти под одну модель. Если машин три и больше, уже понадобится коммутатор.

На одном Spark небольшая модель тянет 64 запроса одновременно и печатает суммарно около 483 токенов в секунду. Тяжёлая модель на 284 млрд параметров в одиночный Spark тоже влезает, но если считать по одному запросу, выдаёт всего 21 токен в секунду. Пара Spark разгоняет её до 59 токенов в секунду.

Но тут есть два момента, о которых стоит помнить 🔽

1️⃣Скорость
В свежем тесте ту же Qwen3 Coder 30B сравнили на Spark и на паре RTX 5090. Spark справился с задачей за шесть минут, а две 5090 примерно за минуту. Всё упирается в пропускную способность памяти. 273 ГБ/с против почти двух терабайт у 5090.

2️⃣Качество
Открытая Qwen3 Coder 30B набирает около 48% на SWE bench Verified. Для сравнения, Claude Sonnet 4.6 показывает 79,6%, а Opus 4.6 около 81%. Разница почти в два раза, и добавлением железа её не исправить.

➡️ За $5–10 тыс. уже можно собрать вполне рабочий стенд, чтобы обкатать агентную систему на своих данных и понять, что вообще имеет смысл переносить внутрь компании. А вот под серьёзную промышленную нагрузку понадобится полноценная серверная инфраструктура.

И ещё важно: если нужна максимальная точность и качество, закрытые модели пока остаются заметно впереди.

Видео: techwithray

🌐 Website | 🎰LinkedIn