Для среднего и крупного бизнеса

Своя ИИ-модель внутри контура компании

Разворачиваем языковую модель или ансамбль моделей на ваших серверах. Считаем, сколько нужно мощностей и денег, собираем роадмап, запускаем и учим вашу команду вести это дальше самостоятельно. Данные не покидают периметр компании.

СОТРУДНИКИ КОНТУР КОМПАНИИ LLM EMBED RERANK ВАШИ СЕРВЕРЫ · ВАШИ ДАННЫЕ ВНЕШНИЕ API ДАННЫЕ НЕ УХОДЯТ
Листайте
6 этапов от первого разговора до работающей модели

Компании редко упираются в саму модель - упираются в решения вокруг неё. Сколько нужно карт. Во что это обойдётся. Что скажет служба безопасности. Кто будет это поддерживать через полгода. Мы закрываем именно этот слой: считаем экономику до старта, проводим через согласования, разворачиваем и передаём команде заказчика вместе с навыком.

Кому это нужно

Четыре ситуации,
в которых приходят к нам

Если узнали хотя бы одну - разговор будет предметным.

Служба безопасности закрыла облако

Внутренние политики запрещают отправлять документы во внешние сервисы. Публичные модели отпадают целиком, а задачи никуда не деваются. Нужен вариант, который проходит проверку ИБ - вплоть до полностью изолированного контура без доступа в интернет.

Внешний API дорожает с каждым месяцем

На пилоте счёт был терпимым. С ростом нагрузки экономика перестала сходиться, а отказаться уже нельзя - фича в продукте. При постоянном потоке запросов локальная модель окупается кратно: собственный токен стоит в разы дешевле.

Пилот получился, дальше не идёт

Команда собрала прототип на своём железе, показала демо - и упёрлась. Пропускной способности не хватает, каждая новая задача требует ещё карт, поддерживать самописную сборку некому. Типичный потолок: архитектура прототипа не тянет продовую нагрузку.

Знания есть, доступа к ним нет

Регламенты, инструкции и проектная документация копились годами. Поиск по ним не работает, сотрудники ходят с вопросами к коллегам, новички входят в курс дела месяцами. Модель внутри контура превращает этот архив в рабочий инструмент.

Как идёт проект

Шесть этапов
от первого разговора до передачи команде

Порядок не меняется: сначала считаем и согласовываем, потом разворачиваем. Так клиент видит бюджет и сроки до того, как потрачен первый рубль на железо.

01
Интервью

Разбираемся, какие задачи закрываем и кто будет пользоваться: поиск по документам, обработка потока заявок, анализ звонков, помощь инженерам. Фиксируем, какие данные участвуют и какие ограничения накладывает безопасность.

Результат: перечень задач и ограничений
02
Аудит инфраструктуры

Смотрим, что уже есть: серверы, видеокарты, сеть, кластер, процедуры выделения ресурсов. В крупных компаниях свои правила деплоя, и решение подгоняется под них, а не наоборот. Здесь же выясняем, кто со стороны заказчика будет давать доступы.

Результат: карта текущей инфраструктуры
03
Расчёт мощностей и бюджета

Считаем, сколько карт нужно под вашу нагрузку и что это стоит. Сравниваем стоимость своего токена с текущими расходами на внешние API - если экономика не сходится, честно говорим об этом на этом этапе, а не после закупки железа.

Результат: конфигурация железа и бюджет
04
Роадмап и согласования

Собираем план с реальными сроками. Отдельной строкой - проверка службой информационной безопасности: в крупной компании она занимает до двух месяцев, и это нужно закладывать заранее, а не узнавать в процессе. Готовим документы для ИБ и закупки.

Результат: план со сроками и этапами
05
Развёртывание

Ставим платформу в контуре, поднимаем модели, настраиваем API, мониторинг и учёт токенов. Где базовая модель не тянет отраслевую специфику - дообучаем адаптерами под конкретную задачу. Проверяем качество на бенчмарке, собранном вместе с вашими экспертами.

Результат: работающая модель и метрики качества
06
Обучение команды и сопровождение

Учим вашу команду обновлять модели, добавлять задачи, читать метрики и считать нагрузку. Цель - чтобы через полгода компания вела это сама и не зависела от подрядчика. Дальше остаёмся на связи по сложным вопросам и развитию.

Результат: команда, которая ведёт систему сама
Что именно разворачиваем

Не одна модель,
а рабочий слой инференса

Под «внутренней моделью» обычно понимают одну LLM. На практике для рабочих задач нужен набор компонентов - и все они поднимаются в вашем контуре.

ИСТОЧНИКИ Регламенты и инструкции · Проектная документация · Confluence и вики · Базы данных и СЭД · Звонки и почта КОНТУР КОМПАНИИ · ON-PREMISE LLM генерация ответов Embeddings смысловой поиск Rerank точность выдачи ASR / TTS речь и звонки Дообучение под ваши задачи адаптеры для узких сценариев на той же карте OpenAI-СОВМЕСТИМЫЙ API · МОНИТОРИНГ · УЧЁТ ТОКЕНОВ ПРИЛОЖЕНИЯ Ассистент по базе знаний Проверка документов Аналитика по данным Ваши внутренние сервисы
Вариант 01
Выделенный сервер у облачного провайдера

Модель работает на арендованных мощностях в российском дата-центре, доступ - только у вашей организации. Не нужно закупать железо, старт занимает дни.

Подходит для пилота и быстрой проверки экономики
Вариант 02
On-premise на вашем железе

Платформа ставится в существующий контур компании и подчиняется вашим правилам деплоя и выделения ресурсов. Возможен полностью изолированный режим без выхода в интернет.

Основной вариант для крупных компаний и строгой ИБ
Вариант 03
Программно-аппаратный комплекс

Готовый сервер с предустановленным и настроенным софтом. Приезжает и включается - не нужно подбирать совместимость драйверов, версий и библиотек.

Когда своего подходящего железа нет
Кейсы и цифры

Что даёт перенос
внутрь контура

Проекты, реализованные на платформе, с которой мы работаем. Часть заказчиков названа по именам, часть - под соглашением о конфиденциальности.

Актион · медиа и справочные системы
Сотни тысяч документов на одной видеокарте вместо пяти

Компания обрабатывала базу на сотни тысяч документов самописной сборкой из двух моделей. Пропускной способности не хватало на 100 тысяч генераций в день. После перехода на настроенный инференс нагрузку взяла одна карта - четыре A100 и двадцать CPU освободились под другие задачи.

-60%расходов на облако для LLM
250%возврат вложений
×36пропускная способность одной карты
Сервис аналитики звонков · под NDA
Свой токен вместо внешнего API - в три раза дешевле

Сервис разбирает около 12 тысяч звонков в день по десяти параметрам. Пилот на внешнем API показал качество, но экономика не сходилась, а часть клиентов требовала локальной обработки. Модель перенесли в контур, для двух самых сложных параметров дообучили адаптеры - оба работают на одной карте и переключаются на лету.

0,04 ₽за 1000 токенов против 0,14 у внешнего API
2 картыT4 на весь поток звонков
ТВЭЛ · Госкорпорация Росатом
Поиск по нормативным документам вместо обхода коллег

Сотрудники ежедневно работали с тысячами внутренних документов - локальными нормативными актами и методическими указаниями на сотни тысяч страниц. Облако было закрыто требованиями безопасности. Ассистент развернули в контуре и встроили в корпоративный мессенджер и портал, ответы приходят со ссылкой на конкретный пункт документа.

-85%времени на поиск информации
88%точность ответов
днионбординг вместо недель
Горно-металлургический холдинг
Полностью изолированный контур без доступа в интернет

Плавильный цех: технологи работают с регламентами на тысячи страниц, где таблицы и формулы вперемешку с текстом. Политики компании требовали полной изоляции от внешней сети. Решение прошло двухмесячную проверку службы безопасности, архитектуру подогнали под принятый в компании способ выделения видеокарт.

air-gapконтур без выхода в интернет
85%инженеров оценили качество ответов

Цифры взяты из оформленных кейсов технологического партнёра. Проекты Актион и сервиса аналитики звонков относятся к 2024 году - порядок экономии актуален, конкретные модели с тех пор сменились. Под вашу задачу расчёт делается заново на этапе аудита.

Что дальше

Модель в контуре -
это фундамент, а не финал

Когда слой инференса работает, поверх него собираются прикладные системы. Каждая следующая обходится дешевле предыдущей: инфраструктура уже стоит и оплачена.

Ассистент по базе знаний

Вопрос на обычном языке - ответ со ссылкой на первоисточник. Подключается к вики, хранилищам документов и системам документооборота.

ПоискОнбордингПоддержка
Проверка документов

Договоры и отчётность проходят через набор правил компании: система находит расхождения с требованиями и предлагает правки.

ЮристыКомплаенсФинансы
Аналитика по данным

Вопрос про выручку или остатки на складе превращается в запрос к базе и график. Руководители получают ответ без очереди к аналитикам.

ОперацииПродажиФинансы
Технологическая основа

На чём разворачиваем

Мы не пишем инференс-платформу с нуля - это долго и незачем. Работаем на Compressa: российской платформе от команды, выросшей из МФТИ. Это спин-офф Физтеха с собственной исследовательской лабораторией, инвестициями Phystech Ventures и опытом ИИ-проектов с 2017 года - от R&D для Huawei и Samsung до промышленных внедрений.

Оба ключевых продукта внесены в реестр российского ПО. Для компаний с госучастием это часто обязательное условие закупки, а для службы безопасности - проверяемый факт, а не обещание.

Наша роль - слой вокруг технологии: разобраться в задачах бизнеса, посчитать мощности и деньги, провести через согласования и научить вашу команду работать самостоятельно.

Платформа запуска моделей «Compressa»
Реестр РФ ПО, запись № 31958 · проверить
Платформа поисковых ассистентов «ИнсайтСтрим»
Реестр РФ ПО, запись № 30262 · проверить
Проверка ФСТЭК пройдена
уязвимости в банке угроз не обнаружены
Кто ведёт

Павел Доронин

Павел Доронин
Основатель и CEO образовательной платформы AI Community
  • Обучил работе с ИИ команды крупных российских компаний
  • Ведёт программы для руководителей и продуктовых команд
  • Собирает ИИ-решения руками, а не только рассказывает о них
  • Работает с технологическими партнёрами из МФТИ

Разворачивание модели внутри компании - это на четверть техническая задача. Остальное - разговор с бизнесом о том, зачем это нужно, расчёт денег, прохождение через службу безопасности и закупку, обучение людей.

Мы заходим со стороны задач компании, а не со стороны технологии. Сначала выясняем, где в процессах теряются часы и деньги, и только потом решаем, какая модель и какое железо это закрывают. Если выясняется, что локальная модель вам не нужна - скажем об этом прямо.

Отдельная часть работы - обучение вашей команды. Проект, после которого компания зависит от подрядчика, мы считаем неудачным.

Частые вопросы

Что спрашивают до старта

Короткие ответы на вопросы, которые задают на первой встрече.

Любые модели с открытыми весами: семейства Qwen, GLM, DeepSeek, Llama, Mistral, а также российские открытые модели. Можно развернуть ансамбль - несколько моделей под разные задачи с маршрутизацией запросов между ними: тяжёлая модель на сложные вопросы, лёгкая на массовый поток. Конкретный набор подбирается на этапе аудита под ваши задачи и доступное железо.

Зависит от числа пользователей, длины документов и требований к скорости ответа. Порядок такой: пилот на десятки пользователей поднимается на одной-двух картах, поток в 12 тысяч звонков в день закрывался двумя T4. Расчёт под вашу нагрузку - отдельный этап проекта, и его результат вы получаете до закупки железа.

Модель работает на ваших серверах, запросы и документы остаются в периметре. Возможен полностью изолированный контур без доступа в интернет. Такая конфигурация уже проходила двухмесячную проверку службы информационной безопасности в горно-металлургическом холдинге. Дополнительно ставятся модули контроля: обнаружение персональных данных в запросах и защита от подмены инструкций модели.

Само развёртывание платформы - от нескольких часов до двух дней. Реальный срок определяют согласования: проверка службой безопасности в крупной компании занимает до двух месяцев. Пилот на одном источнике данных запускается за две недели. Честный план со сроками составляется после аудита - до него любые обещания будут выдумкой.

На постоянной нагрузке стоимость токена падает кратно: в проекте аналитики звонков вышло 0,04 рубля за тысячу токенов против 0,14 у внешнего API. Второй эффект - экономия на железе: настроенный инференс сокращает парк карт, в проекте Актион с пяти A100 до одной. При этом на малых объёмах внешний API может оказаться дешевле - мы считаем это на этапе аудита и говорим прямо.

Нет. Платформа отдаёт OpenAI-совместимый API, поэтому код, написанный под OpenAI, переезжает в закрытый контур с минимальными правками. По этой же причине подключаются существующие инструменты - n8n, LibreChat и другие - без замены платформы, на которой уже работает команда.

Сначала настраиваем работу с вашими документами - от этого качество растёт сильнее всего. Если отдельные задачи всё равно проседают, дообучаем модель адаптерами точечно под эти сценарии. Несколько таких адаптеров живут на одной карте и переключаются в зависимости от запроса, так что дополнительное железо не требуется.

Следующий шаг

Разберём вашу ситуацию

На первой встрече обсудим задачи, текущую инфраструктуру и ограничения безопасности. По итогам скажем, нужна ли вам локальная модель и что примерно потребуется по мощностям и бюджету.

Написать в Telegram +7-905-756-99-40