Какую проблему решает корпоративная база знаний с AI?
Сотрудники тратят часы на поиск информации по папкам, чатам и чужим головам. Новички входят в курс месяцами. При увольнении эксперта знания уходят безвозвратно. 65% проектов имеют bus factor 2 и меньше — уход двух человек останавливает процесс.
По данным IDC, knowledge workers тратят ~30% рабочего времени на поиск информации. Для команды из 40 человек это сотни тысяч рублей в месяц потерянного времени.
Кейс: как аутсорсинговая бухгалтерская компания получила AI-ассистента по 12 000 документов?
Первый клиент — досрочное завершение. Бухгалтерский аутсорсинг, 492 клиента, 80 сотрудников.
| Исходные данные | ~12 000 файлов (PDF, DOCX, XLSX, JPEG, MP3, MP4), 18 ГБ на сетевых дисках |
| Доменов знаний | 58 (бухучёт, кадры, налоги, ККТ, ВЭД, маркетплейсы, продажи, юрдокументы...) |
| Оцифровано | ~5 400 файлов → ~28 400 поисковых фрагментов |
| Срок (факт) | 21 рабочий день (при плане 40 рабочих дней) |
| Инфраструктура | VPS (4 ядра / 8 ГБ / 40 ГБ SSD), чат-интерфейс + векторная БД + API языковой модели |
| Стоимость | 840 000 ₽ (разработка) + 100 000 ₽ (токены) + 120 000 ₽ (обучение) |
| Итого вложения клиента | 1 060 000 ₽ |
Результат: сотрудник задаёт вопрос в чате — ассистент ищет ответ в 58 доменах знаний и выдаёт конкретный ответ со ссылкой на файл-источник. Не выдумывает. Не даёт юридических консультаций. Не раскрывает пароли и персональные данные.
Что получает клиент после внедрения?
- Единая база знаний — документы, регламенты, видео, аудио, расшифровки встреч собраны в одной системе с единой таксономией
- AI-ассистент — окно чата: сотрудник задаёт вопрос → гибридный поиск (смысл + ключевые слова) → ответ со ссылкой на источник (домен + файл + фрагмент)
- Самонаполнение — сотрудник скидывает файл в чат → система оцифровывает (конвертер → Markdown → эмбеддинг) → администратор подтверждает → доступно для поиска через 30–60 секунд
- Защита от утечки знаний — при увольнении эксперта его знания остаются в базе. ADR, постмортемы, протоколы решений — система фиксирует не только «что», но и «почему было принято именно это решение»
- Измеримый результат: сокращение времени поиска на 60–80% · ускорение онбординга в 2–3 раза · снижение нагрузки на экспертов
Как проходит внедрение: 7 этапов за 21–40 дней
| 1. Аудит | Инвентаризация источников: сетевые диски, CRM, чаты, видео, регламенты. Оценка форматов, качества, bus factor критических знаний. 3–5 дней |
| 2. Архитектура | Проектирование таксономии (≤3 уровней) и фасетов под домены клиента. Определение метаданных и политик доступа. 1–2 дня |
| 3. Оцифровка | Конвертация всех форматов → AI-читаемый Markdown. Семантический чанкинг, мультиязычная модель эмбеддингов. 5–15 дней |
| 4. Развёртывание | Подъём сервера (VPS клиента), контейнеризация: чат-интерфейс + векторная БД + реляционная СУБД. Данные не покидают контур компании. 1–2 дня |
| 5. AI-ассистент | Настройка гибридного поиска (ключевые слова + семантика + реранкинг), системного промпта, тестирование качества (стандартные метрики). 2–3 дня |
| 6. Извлечение знаний | Интервью с ключевыми экспертами (CDM-протокол), фиксация критических решений (ADR), аудит bus factor. 1–2 дня |
| 7. Обучение и передача | Воркшоп команды + документация + регламент наполнения + карта таксономии + чек-лист приёмки. 1 день |
Полный цикл: до 40 рабочих дней. Наш клиент — 21 рабочий день.
Технический стек
| Инфраструктура | VPS клиента — данные не покидают контур компании |
| Векторная БД | Гибридный поиск (ключевые слова + семантический) с реранкингом |
| Чат-интерфейс | Веб-интерфейс для сотрудников |
| Хранение | Реляционная СУБД — диалоги и метаданные |
| Пайплайн оцифровки | Специализированные конвертеры (структурированный Markdown), система распознавания текста (сканы), система транскрибации (аудио), семантический чанкинг |
| LLM | Клиент выбирает языковую модель под свой контур |
Сколько стоит корпоративная база знаний с ИИ?
Точная цена — после инвентаризации. Зависит от объёма (сотни vs тысячи vs десятки тысяч файлов), доли нетекстовых форматов, количества доменов и глубины интеграций.
Типовой эффект для команды из 80 человек:
- 30 сотрудников × 2 ч/день на поиск × 22 дня × 800 ₽/ч = 1 056 000 ₽/мес потерь
- Снижение времени поиска на 70% = экономия ~740 000 ₽/мес
- Внедрение окупается за 1,5–2 месяца
10 выводов после внедрения
- Досрочно — это норма. При правильной инвентаризации и repeatable-пайплайне реальный срок — 3–4 недели. Узкое место не оцифровка, а утверждение списка источников клиентом.
- Версионность — не техническая, а управленческая проблема. Кто и когда верифицирует документы? Техника — лишь поддержка. Нужен назначенный Knowledge Steward на стороне клиента.
- VPS клиента — правильная архитектура. Данные не покидают контур компании. Для режимных объектов — локальные языковые модели вместо API.
- Модерация контента откладывается. Первый запуск — без неё: база наполняется централизованно, сотрудники только читают.
- Гибридный поиск — must-have. Чистый семантический проваливается на точных запросах (номера счетов, коды). Ключевые слова + эмбеддинги + реранкинг — минимальный стек.
- Качество RAG нужно измерять. Стандартные метрики (faithfulness, relevance) встроены в приёмку. Без них невозможно доказать клиенту, что ассистент не выдумывает.
- Контейнеризация обязательна. Нативная сборка чат-интерфейса нестабильна. Минимум: 4 vCPU, 8 ГБ RAM, 40 ГБ SSD.
- ~5% файлов — мусор. Битые PDF, дубликаты, устаревшие версии. Аудит качества до массовой оцифровки экономит день правок.
- Специализированный конвертер, а не офисный. Конвертация через специализированный конвертер даёт на порядок лучшее сохранение структуры — таблицы, reading order, формулы — чем связка офисного конвертера и PDF-библиотеки.
- Эксперты уходят — знания остаются. Структурированные интервью с ключевыми сотрудниками и документирование архитектурных решений — не опция, а обязательная часть внедрения.
Что мы не делаем
- Просто «структурирование базы знаний» без AI-ассистента — это не наша специализация
- Модерацию и живое ведение сообществ — зона клиента
- Интеграции с закрытыми проприетарными системами без API
- Хранение клиентских персональных данных в базе (конфиденциальность)
Дальше
V1 — Фундамент и память. Единая база знаний + AI-ассистент. Запуск за 21–40 рабочих дней.
V2 — Интеграции. Подключение к рабочим системам клиента (CRM, Slack, 1С, почта). Ролевой контекст: ассистент понимает, кто спрашивает, и учитывает уровень доступа.
V3 — Агенты. AI-агенты, которые не просто ищут, а действуют: авто-классификация, обнаружение дубликатов и противоречий, флагование устаревшего.
Параллельно — AI-Аудит Бэк-Офиса. Выявление следующих задач под автоматизацию. Интеллект компании и AI-агенты усиливают друг друга: база знаний даёт контекст агентам, агенты генерируют новые знания для базы.