Продакшн LLM на локальній інфраструктурі для оборонного підрядника без доступу до хмари
Європейський оборонний підрядник рівня tier-1 (проєкт 2024 року), чия класифікація безпеки забороняє будь-який інференс ШІ на обладнанні, підключеному до інтернету: будь-який комерційний хмарний API виключили в перший же день. Внутрішня ІТ-команда не мала попереднього досвіду з ML-інфраструктурою. Discovery & Blueprint спершу окреслив апаратні обмеження: два GPU NVIDIA A6000 (по 48 ГБ VRAM кожен). Ми обрали Llama 3 8B, квантизовану до 4 біт (GGUF), що працює через llama.cpp; побудували просту REST API-обгортку, вебінтерфейс для аналітиків і пакет розгортання, який ІТ-команда могла встановити й експлуатувати без експертизи в ML. Затримка інференсу p95: 4,2 с на цільовому обладнанні. ІТ-команда досягла самостійної роботи через 3 тижні після передачі. Жодної залежності від хмари на жодному етапі пайплайну.
100%
Ізольоване розгортання
4.2s
Затримка інференсу p95
3wk
Від передачі до самостійності ІТ
Виклик
Класифікація безпеки клієнта вимагала, щоб увесь інференс ШІ відбувався на обладнанні, фізично розташованому в захищеному приміщенні без підключення до інтернету. Комерційні хмарні API були повністю виключені. Внутрішня ІТ-команда не мала попереднього досвіду з ML-інфраструктурою.
Наш підхід
Discovery & Blueprint став критичною фазою: ми окреслили апаратні обмеження, ліміти розміру моделі та вимоги до інференсу, перш ніж рекомендувати будь-яку модель. У клієнта було два GPU NVIDIA A6000 (по 48 ГБ VRAM кожен).
Ми обрали Llama 3 8B, квантизовану до 4 біт (формат GGUF), що працює через llama.cpp на наявному обладнанні. Ми побудували просту REST API-обгортку, вебінтерфейс для аналітиків і пакет розгортання, який ІТ-команда могла встановити й експлуатувати без експертизи в ML.
Результат
Повністю ізольоване від мережі розгортання LLM працює в продакшні. Затримка інференсу p95: 4,2 секунди на запит на цільовому обладнанні. ІТ-команда досягла самостійної роботи протягом 3 тижнів після передачі. Жодної залежності від хмари на жодному етапі пайплайну.
Чого ми навчились
01
Апаратні обмеження мають визначати вибір моделі, а не навпаки.
02
Квантизація робить LLM придатними для роботи на неспеціалізованому обладнанні.
03
Передача ІТ-команді потребує пакета розгортання, а не лише документації.
Залучені етапи
Discovery & Blueprint
Перевірка концепції
Загальна тривалість
2,5 місяця загалом
Передані артефакти
PRD
Специфікація обладнання
Пакет розгортання
Інструкція з ІТ-експлуатації
Огляд архітектури безпеки
Почніть із дзвінка з оцінки доцільності
2 години, безкоштовно. Чесно скажемо, чи має сенс ШІ саме для вашого випадку.