Разворачиваем языковую модель или ансамбль моделей на ваших серверах. Считаем, сколько нужно мощностей и денег, собираем роадмап, запускаем и учим вашу команду вести это дальше самостоятельно. Данные не покидают периметр компании.
Компании редко упираются в саму модель - упираются в решения вокруг неё. Сколько нужно карт. Во что это обойдётся. Что скажет служба безопасности. Кто будет это поддерживать через полгода. Мы закрываем именно этот слой: считаем экономику до старта, проводим через согласования, разворачиваем и передаём команде заказчика вместе с навыком.
Если узнали хотя бы одну - разговор будет предметным.
Внутренние политики запрещают отправлять документы во внешние сервисы. Публичные модели отпадают целиком, а задачи никуда не деваются. Нужен вариант, который проходит проверку ИБ - вплоть до полностью изолированного контура без доступа в интернет.
На пилоте счёт был терпимым. С ростом нагрузки экономика перестала сходиться, а отказаться уже нельзя - фича в продукте. При постоянном потоке запросов локальная модель окупается кратно: собственный токен стоит в разы дешевле.
Команда собрала прототип на своём железе, показала демо - и упёрлась. Пропускной способности не хватает, каждая новая задача требует ещё карт, поддерживать самописную сборку некому. Типичный потолок: архитектура прототипа не тянет продовую нагрузку.
Регламенты, инструкции и проектная документация копились годами. Поиск по ним не работает, сотрудники ходят с вопросами к коллегам, новички входят в курс дела месяцами. Модель внутри контура превращает этот архив в рабочий инструмент.
Порядок не меняется: сначала считаем и согласовываем, потом разворачиваем. Так клиент видит бюджет и сроки до того, как потрачен первый рубль на железо.
Разбираемся, какие задачи закрываем и кто будет пользоваться: поиск по документам, обработка потока заявок, анализ звонков, помощь инженерам. Фиксируем, какие данные участвуют и какие ограничения накладывает безопасность.
Смотрим, что уже есть: серверы, видеокарты, сеть, кластер, процедуры выделения ресурсов. В крупных компаниях свои правила деплоя, и решение подгоняется под них, а не наоборот. Здесь же выясняем, кто со стороны заказчика будет давать доступы.
Считаем, сколько карт нужно под вашу нагрузку и что это стоит. Сравниваем стоимость своего токена с текущими расходами на внешние API - если экономика не сходится, честно говорим об этом на этом этапе, а не после закупки железа.
Собираем план с реальными сроками. Отдельной строкой - проверка службой информационной безопасности: в крупной компании она занимает до двух месяцев, и это нужно закладывать заранее, а не узнавать в процессе. Готовим документы для ИБ и закупки.
Ставим платформу в контуре, поднимаем модели, настраиваем API, мониторинг и учёт токенов. Где базовая модель не тянет отраслевую специфику - дообучаем адаптерами под конкретную задачу. Проверяем качество на бенчмарке, собранном вместе с вашими экспертами.
Учим вашу команду обновлять модели, добавлять задачи, читать метрики и считать нагрузку. Цель - чтобы через полгода компания вела это сама и не зависела от подрядчика. Дальше остаёмся на связи по сложным вопросам и развитию.
Под «внутренней моделью» обычно понимают одну LLM. На практике для рабочих задач нужен набор компонентов - и все они поднимаются в вашем контуре.
Модель работает на арендованных мощностях в российском дата-центре, доступ - только у вашей организации. Не нужно закупать железо, старт занимает дни.
Платформа ставится в существующий контур компании и подчиняется вашим правилам деплоя и выделения ресурсов. Возможен полностью изолированный режим без выхода в интернет.
Готовый сервер с предустановленным и настроенным софтом. Приезжает и включается - не нужно подбирать совместимость драйверов, версий и библиотек.
Проекты, реализованные на платформе, с которой мы работаем. Часть заказчиков названа по именам, часть - под соглашением о конфиденциальности.
Компания обрабатывала базу на сотни тысяч документов самописной сборкой из двух моделей. Пропускной способности не хватало на 100 тысяч генераций в день. После перехода на настроенный инференс нагрузку взяла одна карта - четыре A100 и двадцать CPU освободились под другие задачи.
Сервис разбирает около 12 тысяч звонков в день по десяти параметрам. Пилот на внешнем API показал качество, но экономика не сходилась, а часть клиентов требовала локальной обработки. Модель перенесли в контур, для двух самых сложных параметров дообучили адаптеры - оба работают на одной карте и переключаются на лету.
Сотрудники ежедневно работали с тысячами внутренних документов - локальными нормативными актами и методическими указаниями на сотни тысяч страниц. Облако было закрыто требованиями безопасности. Ассистент развернули в контуре и встроили в корпоративный мессенджер и портал, ответы приходят со ссылкой на конкретный пункт документа.
Плавильный цех: технологи работают с регламентами на тысячи страниц, где таблицы и формулы вперемешку с текстом. Политики компании требовали полной изоляции от внешней сети. Решение прошло двухмесячную проверку службы безопасности, архитектуру подогнали под принятый в компании способ выделения видеокарт.
Цифры взяты из оформленных кейсов технологического партнёра. Проекты Актион и сервиса аналитики звонков относятся к 2024 году - порядок экономии актуален, конкретные модели с тех пор сменились. Под вашу задачу расчёт делается заново на этапе аудита.
Когда слой инференса работает, поверх него собираются прикладные системы. Каждая следующая обходится дешевле предыдущей: инфраструктура уже стоит и оплачена.
Мы не пишем инференс-платформу с нуля - это долго и незачем. Работаем на Compressa: российской платформе от команды, выросшей из МФТИ. Это спин-офф Физтеха с собственной исследовательской лабораторией, инвестициями Phystech Ventures и опытом ИИ-проектов с 2017 года - от R&D для Huawei и Samsung до промышленных внедрений.
Оба ключевых продукта внесены в реестр российского ПО. Для компаний с госучастием это часто обязательное условие закупки, а для службы безопасности - проверяемый факт, а не обещание.
Наша роль - слой вокруг технологии: разобраться в задачах бизнеса, посчитать мощности и деньги, провести через согласования и научить вашу команду работать самостоятельно.
Разворачивание модели внутри компании - это на четверть техническая задача. Остальное - разговор с бизнесом о том, зачем это нужно, расчёт денег, прохождение через службу безопасности и закупку, обучение людей.
Мы заходим со стороны задач компании, а не со стороны технологии. Сначала выясняем, где в процессах теряются часы и деньги, и только потом решаем, какая модель и какое железо это закрывают. Если выясняется, что локальная модель вам не нужна - скажем об этом прямо.
Отдельная часть работы - обучение вашей команды. Проект, после которого компания зависит от подрядчика, мы считаем неудачным.
Короткие ответы на вопросы, которые задают на первой встрече.
Любые модели с открытыми весами: семейства Qwen, GLM, DeepSeek, Llama, Mistral, а также российские открытые модели. Можно развернуть ансамбль - несколько моделей под разные задачи с маршрутизацией запросов между ними: тяжёлая модель на сложные вопросы, лёгкая на массовый поток. Конкретный набор подбирается на этапе аудита под ваши задачи и доступное железо.
Зависит от числа пользователей, длины документов и требований к скорости ответа. Порядок такой: пилот на десятки пользователей поднимается на одной-двух картах, поток в 12 тысяч звонков в день закрывался двумя T4. Расчёт под вашу нагрузку - отдельный этап проекта, и его результат вы получаете до закупки железа.
Модель работает на ваших серверах, запросы и документы остаются в периметре. Возможен полностью изолированный контур без доступа в интернет. Такая конфигурация уже проходила двухмесячную проверку службы информационной безопасности в горно-металлургическом холдинге. Дополнительно ставятся модули контроля: обнаружение персональных данных в запросах и защита от подмены инструкций модели.
Само развёртывание платформы - от нескольких часов до двух дней. Реальный срок определяют согласования: проверка службой безопасности в крупной компании занимает до двух месяцев. Пилот на одном источнике данных запускается за две недели. Честный план со сроками составляется после аудита - до него любые обещания будут выдумкой.
На постоянной нагрузке стоимость токена падает кратно: в проекте аналитики звонков вышло 0,04 рубля за тысячу токенов против 0,14 у внешнего API. Второй эффект - экономия на железе: настроенный инференс сокращает парк карт, в проекте Актион с пяти A100 до одной. При этом на малых объёмах внешний API может оказаться дешевле - мы считаем это на этапе аудита и говорим прямо.
Нет. Платформа отдаёт OpenAI-совместимый API, поэтому код, написанный под OpenAI, переезжает в закрытый контур с минимальными правками. По этой же причине подключаются существующие инструменты - n8n, LibreChat и другие - без замены платформы, на которой уже работает команда.
Сначала настраиваем работу с вашими документами - от этого качество растёт сильнее всего. Если отдельные задачи всё равно проседают, дообучаем модель адаптерами точечно под эти сценарии. Несколько таких адаптеров живут на одной карте и переключаются в зависимости от запроса, так что дополнительное железо не требуется.
На первой встрече обсудим задачи, текущую инфраструктуру и ограничения безопасности. По итогам скажем, нужна ли вам локальная модель и что примерно потребуется по мощностям и бюджету.