Skip to content
Внутрішній та приватний AIПриватна LLMCASE_12

Продакшн LLM на локальній інфраструктурі для оборонного підрядника без доступу до хмари

Європейський оборонний підрядник рівня tier-1 (проєкт 2024 року), чия класифікація безпеки забороняє будь-який інференс ШІ на обладнанні, підключеному до інтернету: будь-який комерційний хмарний API виключили в перший же день. Внутрішня ІТ-команда не мала попереднього досвіду з ML-інфраструктурою. Discovery & Blueprint спершу окреслив апаратні обмеження: два GPU NVIDIA A6000 (по 48 ГБ VRAM кожен). Ми обрали Llama 3 8B, квантизовану до 4 біт (GGUF), що працює через llama.cpp; побудували просту REST API-обгортку, вебінтерфейс для аналітиків і пакет розгортання, який ІТ-команда могла встановити й експлуатувати без експертизи в ML. Затримка інференсу p95: 4,2 с на цільовому обладнанні. ІТ-команда досягла самостійної роботи через 3 тижні після передачі. Жодної залежності від хмари на жодному етапі пайплайну.

100%
Ізольоване розгортання
4.2s
Затримка інференсу p95
3wk
Від передачі до самостійності ІТ

Виклик

Класифікація безпеки клієнта вимагала, щоб увесь інференс ШІ відбувався на обладнанні, фізично розташованому в захищеному приміщенні без підключення до інтернету. Комерційні хмарні API були повністю виключені. Внутрішня ІТ-команда не мала попереднього досвіду з ML-інфраструктурою.

Наш підхід

Discovery & Blueprint став критичною фазою: ми окреслили апаратні обмеження, ліміти розміру моделі та вимоги до інференсу, перш ніж рекомендувати будь-яку модель. У клієнта було два GPU NVIDIA A6000 (по 48 ГБ VRAM кожен). Ми обрали Llama 3 8B, квантизовану до 4 біт (формат GGUF), що працює через llama.cpp на наявному обладнанні. Ми побудували просту REST API-обгортку, вебінтерфейс для аналітиків і пакет розгортання, який ІТ-команда могла встановити й експлуатувати без експертизи в ML.

Результат

Повністю ізольоване від мережі розгортання LLM працює в продакшні. Затримка інференсу p95: 4,2 секунди на запит на цільовому обладнанні. ІТ-команда досягла самостійної роботи протягом 3 тижнів після передачі. Жодної залежності від хмари на жодному етапі пайплайну.

Чого ми навчились

01

Апаратні обмеження мають визначати вибір моделі, а не навпаки.

02

Квантизація робить LLM придатними для роботи на неспеціалізованому обладнанні.

03

Передача ІТ-команді потребує пакета розгортання, а не лише документації.

Залучені етапи
Discovery & Blueprint
Перевірка концепції
Загальна тривалість
2,5 місяця загалом
Передані артефакти
PRD
Специфікація обладнання
Пакет розгортання
Інструкція з ІТ-експлуатації
Огляд архітектури безпеки
Почніть із дзвінка з оцінки доцільності

2 години, безкоштовно. Чесно скажемо, чи має сенс ШІ саме для вашого випадку.

Забронювати дзвінок