ИИ-транскрибация встреч и приёмов: как юрфирма и клиника получают протокол без секретаря
Я почти двадцать лет чиню айти-хозяйство небольших контор — юрфирм, клиник, бухгалтерий. Последние полгода у половины клиентов один и тот же вопрос: можно ли записать встречу и через десять минут получить готовый текст, а не расшифровку на коленке в блокноте. Можно. И это не фантастика про роботов, а вполне рабочий процесс, который я собирал у двух клиентов — юридической фирмы и стоматологической клиники. Расскажу честно, что получилось, а где пришлось повозиться.
Секретарь на записи встречи — это дорогое удовольствие
Начну с боли, которую слышу постоянно. У юриста встреча с клиентом час-полтора. После неё нужно составить протокол: кто что сказал, какие обязательства взял на себя доверитель, какие сроки назвал. В идеале это делает помощник или секретарь, который сидит рядом с блокнотом. На практике либо этого человека нет в штате, либо он занят другим, либо протокол пишут по памяти вечером, когда половина деталей уже стёрлась.
У одного клиента, небольшой юрфирмы на 12 человек в районе Таганки, секретарь стоил 65 тысяч рублей в месяц. Треть его времени уходила именно на протоколирование встреч и совещаний. Посчитали — выходит под 20 тысяч в месяц просто за то, чтобы кто-то записывал разговор ручкой. При этом качество записи всё равно хромало: человек устаёт, пропускает нюансы, а на суде важна каждая формулировка.
В клинике история другая, но суть та же. Врач на приёме и разговаривает с пациентом, и параллельно должен вбивать данные в медкарту. Согласитесь, трудно одновременно слушать жалобы и печатать. В итоге либо приём затягивается, либо запись в карте получается куцей — три строчки вместо нормального анамнеза.
Что технически происходит внутри такой системы
Схема на самом деле простая. Есть источник звука — диктофон, микрофон в переговорке или запись из Zoom. Есть сервис распознавания речи, который переводит аудио в текст. И есть слой ИИ поверх — тот же GigaChat или что-то на базе GPT-моделей, который берёт сырую расшифровку и превращает её в структурированный документ: кто говорил, что обещал, какие сроки назвал, какие пункты спорные.
Отдельно стоит сказать про диаризацию — это когда система понимает, что фразу произнёс не абстрактный «голос», а конкретно Иванов, а следующую — Петрова. Без этого протокол превращается в кашу. Yandex SpeechKit и зарубежный Whisper умеют это делать довольно неплохо, но точность сильно зависит от качества записи. Если разговор идёт в шумном кабинете с открытым окном на Ленинградке — распознавание проседает процентов на 15-20.
Мы для юрфирмы собрали связку: конференц-микрофон Jabra за 18 тысяч рублей, запись через встроенный рекордер Zoom (клиенты у них часто удалённые), дальше аудио автоматически летит в скрипт на Whisper, а структурирование текста делает GigaChat через API. Итоговый протокол падает в папку на Google Диске через двадцать минут после звонка. Никакой магии, обычный конвейер из трёх сервисов, склеенных питоном.
Кейс юрфирмы: протокол совещания без единого секретаря
Внедряли мы это три месяца назад. Сначала были сомнения — юристы народ дотошный, боялись, что ИИ переврёт формулировку и потом это всплывёт на процессе. Договорились на компромисс: система готовит черновик, юрист проверяет и подписывает. То есть человек из процесса не исчезает, просто его работа сместилась с ручного набора текста на вычитку.
Результат за квартал: время на подготовку протокола совещания упало с сорока минут до семи-десяти. Секретаря в итоге не сократили — она занялась документооборотом, чем и должна была заниматься изначально. А точность протокола, как ни странно, выросла. Человек на слух пропускает детали, особенно если совещание идёт бодро и все перебивают друг друга. Модель фиксирует всё, включая моменты, когда клиент сам себе противоречил — а это на суде бывает золотом.
Был забавный случай. На одной из встреч клиент в сердцах бросил фразу «ну хорошо, я согласен на ваши условия», а через неделю утверждал, что ничего такого не говорил. Протокол с таймкодом и точной цитатой снял вопрос за минуту. Без записи это была бы битва воспоминаний, а так — факт.
Кейс клиники: приём без потерянных деталей анамнеза
Со стоматологией всё было сложнее — там своя терминология, которую общие модели распознают со скрипом. «Пульпит», «депульпирование», «окклюзия» — обычный Whisper на голом виде путает эти слова с чем угодно. Пришлось дообучать словарь, добавлять список терминов вручную. Заняло это недели две возни, зато сейчас точность на профессиональной лексике держится в районе 92-94 процентов.
Сама схема у клиники такая: диктофон лежит на столе врача, включается кнопкой в начале приёма. После записи текст автоматически структурируется в блоки — жалобы, анамнез, объективный осмотр, диагноз, назначения. Врач эти блоки просто переносит или копирует в МИС одним кликом, а не набирает заново. Средний приём сократился минут на пять — за счёт того, что не нужно параллельно печатать.
Главный владелец клиники, кстати, скептик по натуре, за первый месяц пересчитал, сколько приёмов в день врачи теперь успевают провести. Получилось на два-три больше, притом что никто не торопился и не срезал разговор с пациентом. Просто исчезла беготня с клавиатурой между репликами.
Подводные камни, о которых молчат в рекламных роликах
Первое и самое серьёзное — персональные данные. И в юрфирме, и в клинике на записи звучат сведения, подпадающие под 152-ФЗ: диагнозы, обстоятельства дел, паспортные данные. Отправлять такое в облачный сервис без разбору — прямой путь к штрафу от Роскомнадзора. Мы для клиники настояли на локальном хранении аудио и явном письменном согласии пациента на запись приёма — это отдельная строчка в информированном согласии, минута работы, а нервов бережёт много.
Второе — качество звука решает почти всё. В переговорке с эхом, при плохом микрофоне или когда два человека говорят одновременно, распознавание сыпется. Мы через это прошли: первую неделю юрфирма писала на встроенный микрофон ноутбука, и половина протоколов выходила с дырами. Поменяли на выносной микрофон — проблема исчезла почти полностью.
Третье — доверие к автоматике не должно быть слепым. Однажды система в клинике перепутала «нет аллергии» с «есть аллергия» — из-за невнятной дикции пациента. Хорошо, что врач по протоколу перечитывает черновик перед сохранением в карту. Без этой проверки такая ошибка могла стать по-настоящему опасной. ИИ здесь помощник, а не последняя инстанция, и это надо прописывать в регламенте прямо, а не держать в уме.
Сколько это стоит и с чего начать внедрение
По деньгам вышло скромнее, чем ожидали оба клиента. Разовая настройка связки — микрофон, скрипт распознавания, интеграция с рабочей папкой или МИС — обошлась в 45-70 тысяч рублей в зависимости от сложности. Дальше только подписка на API распознавания и генерацию текста, это в среднем 3-8 тысяч рублей в месяц при обычной нагрузке в 15-20 встреч в неделю.
Для сравнения: секретарь на полставки под протоколирование — от 35 тысяч в месяц. Окупаемость системы у юрфирмы вышла на второй месяц, у клиники — примерно на четвёртый, потому что там была задача не заменить человека, а разгрузить врача. Экономика в обоих случаях простая: считаете, сколько часов в месяц уходит на ручное протоколирование, умножаете на стоимость этого часа и сравниваете с подпиской плюс разовой настройкой.
С чего начать, если решили попробовать: возьмите одну-две встречи в неделю и прогоните их через бесплатную версию Whisper или Яндекс.Спич — просто чтобы понять, тянет ли качество вашей записи распознавание вообще. Дальше уже смотрите на структурирование текста и интеграцию. Не пытайтесь сразу строить идеальный конвейер под все отделы — начните с одного направления, обкатайте, потом масштабируйте.
Частые вопросы
Законно ли записывать консультацию с клиентом или приём пациента на диктофон?
Да, но с обязательным условием — человека нужно уведомить и получить согласие, лучше письменное. Для клиники это отдельный пункт в информированном согласии, для юрфирмы — фраза в начале встречи плюс согласие в договоре. Без этого запись можно использовать разве что для внутренних заметок, но не как доказательство.
Насколько точно ИИ распознаёт профессиональные термины — юридические или медицинские?
Базовые модели вроде Whisper без доработки путают специфическую лексику довольно часто, точность может падать до 70-75 процентов. После добавления словаря терминов и небольшой настройки под конкретную область точность у наших клиентов вышла на уровень 90-95 процентов, что уже достаточно для рабочего черновика.
Можно ли обойтись бесплатными инструментами без месячной подписки?
Для редких разовых расшифровок — вполне, локальный Whisper бесплатен и работает офлайн, что заодно снимает вопрос с персональными данными. Но структурирование текста в протокол или карту приёма уже требует модели уровня GigaChat или GPT, а это платный API, пусть и недорогой при небольших объёмах.
Заменяет ли это секретаря или ассистента врача полностью?
В обоих наших кейсах — нет, и мы сознательно так не делали. Система готовит черновик, человек проверяет и утверждает. Это снижает нагрузку и экономит время, но финальную ответственность за текст протокола или запись в карте всё равно несёт юрист или врач, а не алгоритм.
Приходите в «АйТи-Фреш», за две недели соберём и настроим ИИ-транскрибацию под вашу юрфирму или клинику с учётом 152-ФЗ.
Бесплатная консультация →
Подпишитесь на рассылку ITfresh
Раз в неделю — практические гайды для руководителя и сисадмина: безопасность, 1С, миграции, резервные копии, лайфхаки из реальных проектов.
