ри места, где ИИ-расшифровка врёт: как поймать выдуманную цитату до публикации
Автоматическая расшифровка не оставляет пробелов. Там, где человек написал бы «неразборчиво», модель напишет что-нибудь связное — грамотное, похожее на речь спикера и полностью выдуманное. Для журналиста это худший вид ошибки: опечатку простят, приписанные слова — нет.

Автоматическая расшифровка стала нормой: полуторачасовое интервью превращается в текст за несколько минут, и никто уже не сидит с наушниками и педалью. Но у этой скорости есть неприятная особенность, о которой не пишут в рекламе сервисов.
ИИ-расшифровка не оставляет пробелов. Там, где человек написал бы
«неразборчиво», модель напишет что-нибудь связное. Грамматически безупречное, стилистически похожее на речь спикера — и полностью выдуманное.
Для журналиста это худший вид ошибки. Опечатку заметят и простят, выдуманную цитату — нет.
Мы делаем сервис расшифровки и за это время обработали 2594 записи общей длительностью 257 часов. Разбирая жалобы и сбои, мы увидели, что модель врёт не случайно, а в трёх довольно предсказуемых местах. Знать их полезно всем, кто работает с расшифровками, — независимо от того, каким сервисом вы пользуетесь.
Место первое: тишина
Самое частое. Пауза, шорох, вздох, пустая дорожка в конце файла — и модель заполняет их текстом.

Классический пример, который видел почти каждый, кто расшифровывал видео: в конце записи появляются титры несуществующего переводчика — «Субтитры сделал такой-то». В исходнике этой фразы нет и никогда не было. Модель обучалась в том числе на субтитрах, где такая строка стоит в конце, — и честно воспроизводит привычный ей финал.
Бывает и хуже: на длинной паузе посреди интервью появляется осмысленная реплика, которой не было.
Как ловить. Смотрите на начало и конец файла и на места, где по тайм-кодам идёт пауза. Если фраза стоит особняком, не связана с соседними и звучит «слишком гладко» — включите этот фрагмент и послушайте.
Место второе: зацикливание на куске записи
Модель может «залипнуть»: несколько раз подряд повторить одну фразу или выдать абзац, где предложения отличаются одним словом. Обычно это происходит на плохом участке — гул, наложение голосов, микрофон отвернули.
Коварство в том, что вся остальная расшифровка при этом нормальная. Человек проверяет начало, видит адекватный текст и дальше доверяет файлу целиком.
Как ловить. Ищите повторы. Если один и тот же оборот встречается три-четыре раза подряд — это почти наверняка сбой, а не особенность речи. Мы у себя измеряем такие участки автоматически: считаем долю уникальных слов на отрезке, и когда она падает ниже половины, помечаем фрагмент как подозрительный.
Место третье: неверно указанный язык
Неочевидное. Многие сервисы предлагают выбрать язык записи вручную — и кажется, что указать его точно лучше, чем положиться на автоматику.
На практике наоборот. Если запись двуязычная, если в русской речи много терминов на английском или спикер говорит с сильным акцентом — жёстко заданный язык заставляет модель втискивать звук в неподходящую фонетику. Качество падает резко, вплоть до бессвязного текста.
Как ловить. Ставьте определение языка автоматически, если сервис это умеет. Ручной выбор оставьте для случаев, когда автоматика ошиблась.
Что ещё влияет сильнее, чем кажется
Громкость. Тихая запись с диктофона распознаётся заметно хуже — не потому, что модель «не слышит», а потому что на низком уровне сигнала шум сопоставим с речью. Выравнивание громкости перед расшифровкой даёт больше прироста точности, чем смена сервиса.
Длина. По нашим данным, каждая четвёртая запись короче минуты, а 85% — короче пятнадцати. Короткие файлы обманчивы: на них мало контекста, и модели не на что опереться при спорном слове.
Короткий чек-лист перед публикацией
1. Прочитать начало и конец — там живут фантомные фразы.
2. Найти повторы: три одинаковых оборота подряд — сигнал.
3. Проверить на слух каждую цитату, которая пойдёт в текст. Каждую, а не выборочно.
4. Сверить имена, должности, названия компаний и все числа — их модель искажает чаще всего.
5. Если фрагмент звучит слишком складно для устной речи — это повод послушать оригинал.
Расшифровка экономит часы, но она не снимает ответственности за цитату. Правило простое: машина готовит черновик, публикует человек.
—
Материал подготовлен на данных сервиса расшифровки Свиток



Комментарии