АйТи Фреш
Главная / Статьи / ИИ и нейросети
ИИ и нейросети

ИИ-транскрибация совещаний: протокол готов за 5 минут, а не после того как секретарь неделю его вылизывал

Автор: Семёнов Евгений Сергеевич, директор ООО «АйТи-Фреш» · 2026-08-06
ИИ-транскрибация совещаний: протокол готов за 5 минут, а не после того как секретарь неделю его вылизывал

Полтора года назад я на планёрке в очередной раз слушал, как менеджер по продажам пересказывает своими словами, о чём договорились с клиентом три дня назад — потому что протокол так и не написали. Сейчас у нас после каждой встречи готовый текст лежит в чате через пять минут после того, как договор положили трубку. Расскажу, как это работает и почему я категорически не отдал бы записи переговоров в общий облачный ИИ.

Почему протокол совещания — это всегда боль

У меня штат небольшой, 23 человека. Отдельного секретаря нет и не будет — это неоправданная роскошь для компании такого размера. Протоколы писал кто придётся: то менеджер проекта, то я сам вечером по памяти. Получалось криво. Кто-то забывал зафиксировать сроки, кто-то путал, кто именно из клиентской стороны за что отвечает.

Классика жанра: договорились на встрече, что бухгалтерия клиента до пятницы присылает акты сверки, а у меня в голове осталось только общее "договорились по срокам". Через две недели выясняется, что никто ничего никому не присылал, потому что письменной фиксации не было. Знакомо, да?

А теперь умножьте это на юрфирму, где на встрече с клиентом обсуждают формулировки договора, или на медклинику, где на планёрке разбирают жалобу пациента. Там цена ошибки в протоколе — не просто неловкость, а реальный риск.

Соблазн простой — и почему я его не поддался

Казалось бы, всё уже придумано за нас. Zoom пишет транскрипт сам, в Teams есть Copilot, Otter.ai и Fireflies рекламируются на каждом углу, а можно вообще закинуть аудиофайл в обычный чат-бот и попросить сделать протокол. Быстро, бесплатно почти, никакой возни с серверами.

Я сам так делал год назад, пока не остановился и не подумал: а куда вообще уходит эта запись? Ответ неприятный. Аудио и текст совещания улетают на серверы стороннего сервиса, часто зарубежного, и там оседают — используются для обучения моделей, хранятся неопределённое время, доступны сотрудникам сервиса по регламенту поддержки. А на совещании у меня, например, обсуждались условия контракта с клиентом, суммы, персональные данные сотрудников, иногда — детали спора с контрагентом.

Для юрфирмы это вообще прямое нарушение адвокатской тайны, если запись консультации с доверителем уходит на чужой сервер за океаном. Для медклиники — потенциальное нарушение 152-ФЗ, если в записи фигурируют персональные данные пациентов. Я не готов ставить репутацию компании и доверие клиентов на кон ради удобства одной кнопки "загрузить в облако".

Что значит «локальная и защищённая обработка» на практике

Что значит «локальная и защищённая обработка» на практике

Идея простая: модель распознавания речи и модель, которая делает из расшифровки связный протокол, работают либо прямо у вас на сервере, либо на изолированном контуре, куда кроме вас никто не заходит. Запись не покидает вашу инфраструктуру ни на секунду.

Технически это выглядит так. Для распознавания речи мы используем открытую модель Whisper (у неё есть версии разного размера — от совсем лёгкой до тяжёлой, с почти идеальным качеством на русском языке), развёрнутую на собственном сервере с видеокартой. Дальше текст расшифровки прогоняется через ИИ-модель, которая уже умеет писать связный текст, — но и она развёрнута локально или в защищённом контуре, а не в публичном чате условного сервиса.

Разница принципиальная: в облачном варианте вы отправляете аудиофайл незнакомому серверу и надеетесь на политику конфиденциальности. В локальном варианте файл вообще никуда не уходит — он обрабатывается на железе, которое стоит у вас в серверной или в арендованном изолированном облаке, куда доступ есть только у вас.

Как это выглядит у меня в компании — реальный сценарий

На планёрке или на звонке с клиентом включается диктофон — обычно телефон или Zoom с локальной записью на диск, без выгрузки в облако Zoom. После встречи файл кидается в отдельную папку на нашем сервере, скрипт подхватывает его автоматически.

Дальше — распознавание речи с разделением по говорящим (кто что сказал, а не сплошная простыня текста), потом модель формирует структурированный протокол: участники, обсуждённые вопросы, принятые решения, кто и что должен сделать, срок. Весь процесс занимает от трёх до семи минут в зависимости от длины записи — часовое совещание обрабатывается минут за пять.

Готовый текст падает в Telegram-чат проекта и одновременно сохраняется в CRM карточкой к клиенту. Менеджеру остаётся быстро глазами пробежать и поправить пару опечаток, если модель не разобрала специфичный термин или фамилию. У одного нашего клиента — бухгалтерской фирмы — раньше протокол согласования по клиенту готовили на следующий день, а то и через день. Сейчас он у бухгалтера в чате раньше, чем клиент успевает написать первое уточняющее письмо.

Что нужно, чтобы это внедрить у себя

Железо — не космос. Для компании до 50 рабочих мест хватает сервера с одной видеокартой уровня RTX 4060 Ti или чуть выше, 16-24 гигабайта видеопамяти достаточно для комфортной работы моделей распознавания и генерации текста. Такой сервер стоит в районе 150-250 тысяч рублей единоразово, плюс электричество и место в серверной — у нас он вообще стоит в той же стойке, что и терминальный сервер 1С.

Если своя серверная — не вариант, есть промежуточный путь: арендованный виртуальный сервер с GPU у российского провайдера, с NDA и договором о защите данных, где никто кроме вас физически не имеет доступа к контейнеру. Это дороже в моменте — от 15-20 тысяч рублей в месяц за аренду мощности, — зато не надо возиться с железом самому.

Из софта — Whisper и модель для генерации текста open-source, платить за лицензию не нужно, платите только за инфраструктуру и работу того, кто это настроит и подружит с вашей CRM или чатом. У нас настройка заняла примерно две недели — с учётом отладки распределения по говорящим, которое поначалу путало похожие голоса.

Сколько это реально экономит

Сколько это реально экономит

Ставка секретаря или помощника руководителя, который тратит на протоколы хотя бы час в день, — это условно 25-30 тысяч рублей в месяц только за эту функцию, если считать по времени. У нас таких встреч штук пять-семь в неделю, значит на ручном протоколировании уходило часов десять в неделю рабочего времени сотрудника, который мог бы заниматься чем-то более полезным.

Но экономия времени — не главное. Главное — качество и скорость. Решения, зафиксированные и разосланные участникам в течение пяти минут после встречи, выполняются заметно чаще, чем те, что "как-нибудь потом запишем". Люди ещё помнят контекст, спорных моментов почти не возникает — все видят один и тот же текст сразу.

Есть и побочный эффект, который я не ожидал: сотрудники стали аккуратнее говорить на встречах. Знание, что всё дословно фиксируется, дисциплинирует не хуже любого регламента.

Где можно споткнуться

Первая ошибка — доверить настройку случайному фрилансеру без понимания вопросов безопасности, который в итоге всё равно завяжет обработку на внешний API условного облачного ИИ ради простоты. Спрашивайте прямо: куда физически уходит аудиофайл на каждом этапе обработки. Если ответ расплывчатый — это красный флаг.

Вторая — переоценить качество распознавания на старте. Русская речь с акцентом, специфичные термины отрасли (у клиники это медицинская терминология, у производства — названия деталей и оборудования) поначалу дают процент ошибок повыше. Модель нужно донастраивать: добавлять словарь терминов, тестировать на своих реальных записях, а не на демо-примерах.

Третья, самая обидная — забыть про регламент хранения. Записи совещаний с чувствительной информацией нужно не только не отправлять в чужое облако, но и у себя не хранить вечно без причины. Мы храним исходные аудиофайлы 30 дней, а сами протоколы — уже без аудио — сколько нужно для работы. Это тоже часть защиты данных, а не только выбор локального ИИ.

Частые вопросы

Чем локальная транскрибация принципиально отличается от Zoom AI Companion или Otter.ai?
Тем, куда уходит запись. В облачных сервисах аудио и текст обрабатываются на серверах провайдера, часто зарубежных, и попадают под его политику хранения и использования данных. При локальной обработке файл никогда не покидает вашу инфраструктуру — сервер стоит у вас или в изолированном контуре, доступ к которому есть только у вашей компании.

Насколько хорошо локальные модели распознают русскую речь по сравнению с облачными сервисами?
На сегодняшний день модель Whisper старших версий распознаёт русскую речь на уровне, сравнимом с коммерческими облачными сервисами, особенно если голоса записаны без сильного шума и наложений. Специфичную терминологию отрасли можно донастроить словарём — у нас на это ушло около недели тестов.

Обязательно ли иметь свой сервер, или можно обойтись без покупки железа?
Не обязательно. Можно арендовать виртуальный сервер с видеокартой у российского провайдера с договором о защите данных — это исключает капитальные затраты, но добавляет ежемесячный платёж. Для компании до 50 рабочих мест оба варианта окупаются в течение нескольких месяцев за счёт экономии времени сотрудников.

Что делать с уже накопленными записями старых совещаний, если их когда-то грузили в облачный сервис?
Отдельно оценить, что именно там было — если фигурировали персональные данные или коммерческая тайна, стоит запросить у сервиса удаление данных и проверить их политику хранения. На будущее — просто перестать туда что-либо загружать и перейти на локальный контур для всех новых записей.

Хотите протокол за 5 минут вместо секретаря — и без единого байта переговоров в чужом облаке?
Настрою локальную ИИ-транскрибацию под вашу компанию — от подбора железа до интеграции с вашей CRM и чатами.
Бесплатная консультация →

Столкнулись с похожей задачей? Обращайтесь — решим

Если у вас происходит что-то из описанного в этой статье — или любая другая проблема с ИТ-инфраструктурой, — обращайтесь в любое время. Мои специалисты и я лично разберём ситуацию, найдём настоящую причину и доведём до решения.

Возьмёмся и за разовую задачу, и за постоянное обслуживание. Первичная консультация — бесплатно и без обязательств.

📞 +7 903 729-62-41 💬 MAX: +7 903 729-62-41 ✈️ Telegram @ITfresh_Boss

С уважением, Семёнов Евгений Сергеевич, директор «АйТи Фреш» — IT-аутсорсинг для компаний до 50 рабочих мест, 15+ лет практики

Подпишитесь на рассылку ITfresh

Раз в неделю — практические гайды для руководителя и сисадмина: безопасность, 1С, миграции, резервные копии, лайфхаки из реальных проектов.

Письмо придёт в течение минутыНе нашли его во «Входящих» — загляните в папку «Спам» или «Промоакции» и нажмите «Не спам». Так все следующие выпуски будут приходить прямо в основную почту.
© ООО «АйТи-Фреш» · Москва · Все статьи