Все разборы

Рубрика: Как это устроено20 минут чтения

Почему распознавание речи в стоматологическом кабинете сложнее, чем кажется

Голосовой ввод в медицине существует не первое десятилетие, и в терапевтическом кабинете он работает. Стоматологический приём выглядит похожей задачей — врач тоже говорит, тоже описывает находки, тоже диктует. На практике это другая задача, и различия не косметические.

Разберём, что именно делает её трудной: сначала со стороны кабинета и речи, затем со стороны техники. Обе части опираются на измерения, а не на общие соображения.

Если нужен шаг назад — к тому, что это вообще за класс инструментов и чем он отличается от диктофона и шаблонов, — это отдельный разбор.

Акустическая обстановка кабинета

Звуковая картина стоматологического приёма устроена не как фоновый шум с редкими всплесками, а наоборот: тишина здесь — короткие промежутки между шумными интервалами, и говорит врач чаще всего именно в шумные.

Источники шума и когда они работают:

ИсточникНа каких этапахХарактер интервалов
Турбинный наконечникПрепарирование, снятие пломбы, раскрытие полости, обработка под коронкуСерии по 10–40 секунд с короткими паузами
Микромотор, угловой наконечникФинишная обработка, полировка, обработка каналовБолее длительные непрерывные интервалы, ниже по тону
СлюноотсосПрактически весь этап работы в полости ртаНепрерывный фон
Хирургический аспираторХирургический приём, работа с обильным отделяемымГромче слюноотсоса, включается импульсно
Ультразвуковой скалерПрофессиональная гигиена, снятие отложенийНепрерывно по несколько минут, высокочастотный
Пистолет вода/воздухПромывание и высушивание после каждого этапаКороткие импульсы, десятки раз за приём
КомпрессорОбеспечивает работу наконечниковПериодические циклы, не привязанные к этапу
Фотополимеризационная лампаОтверждение композитаКороткие интервалы, часто со звуковым сигналом
Вытяжка, вентиляцияВесь приёмПостоянный фон

Измеренные уровни дают представление о масштабе. В работе, где инструменты замерялись в условиях реальной работы, средние значения составили 85,5 дБ для турбинного наконечника при препарировании с включённым пылесосом, 83,8 дБ для понижающего наконечника, 83,5 дБ для хирургического аспиратора и 81,6 дБ для ультразвукового скалера (Otoum et al., Journal of the Royal Medical Services, 2021). В университетской клинике общий диапазон составил 47,0–80,8 дБ(A), причём при работе ультразвуком у кресла превышалось нижнее пороговое значение действия в 80 дБ(A), установленное европейской директивой по шуму на рабочем месте (Antoniadou et al., Applied Sciences, 2023).

Отдельная история — внеротовые аспираторы, распространившиеся после пандемии: у всасывающего отверстия они дают 86,0–96,7 дБ(A). Авторы измерений прямо отмечают, что такой аспиратор «маскирует существенные звуки, в том числе голоса», затрудняя общение во время лечения (Yamada et al., Acoustics, 2023). В том же исследовании экспозиция на уровне уха врача за 32-минутную процедуру составила в среднем 78,2 дБ(A) с пиками около 90 дБ(A) при аэрозольных манипуляциях, тогда как фоновый шум пустого кабинета — 39,8–43,9 дБ(A).

Ключевая особенность, которая важнее абсолютных цифр: шумные интервалы совпадают с моментами, когда врач комментирует происходящее. Врач говорит «убираем размягчённый дентин», «дай воздух», «сухо» ровно тогда, когда работает наконечник и слюноотсос. Тихие промежутки приходятся на опрос в начале приёма и разговор в конце — то есть на те части, где меньше всего клинических данных для карты.

Почему шум турбины бьёт именно в речь

Это самое неочевидное место, и оно объясняет, почему бытовое шумоподавление здесь не спасает.

Спектральный анализ шума воздушной турбины показывает, что пик амплитуды приходится примерно на 4500 Гц, причём одинаково по всем положениям микрофона; механизм — резонанс воздушного слоя внутри головки наконечника, первая собственная частота которого измерена как 4478,92 Гц (Lee & Kwon, BDJ Open, 2022). Более раннее исследование 17 высокоскоростных турбин трёх производителей дало слышимую полосу 5,6 кГц ± 0,73 плюс мощные ультразвуковые компоненты в районе 20, 36 и 46,5 кГц (Barek et al., Clinical Oral Investigations, 1999). Акустическая визуализация шума кабинета проводилась в полосе 3–6 кГц — именно в ней шум «окутывает» лицевую область врача и пациента (Yamada et al., 2023).

Теперь вторая сторона. Разборчивость речи неравномерно распределена по частотам: в октавном варианте расчёта индекса разборчивости речи по стандарту ANSI/ASA S3.5-1997 наибольшие веса важности приходятся на полосы с центрами 2000 Гц (0,2648), 1000 Гц (0,2373) и 4000 Гц (0,2142) — то есть на диапазон 1–4 кГц приходится порядка 71% суммарного веса. Шумовая энергия свистящих и шипящих согласных лежит примерно в полосе 2000–8000 Гц с пиками около 4000–4500 и 7500 Гц.

Сопоставление очевидное: пик шума турбины приходится ровно на ту область, где живут согласные и где сосредоточена значительная часть разборчивости. Это не фоновая помеха, которую можно вычесть, — это шум, конкурирующий с речью за один и тот же частотный ресурс. Публикации, прямо сопоставляющей эти два спектра, найти не удалось, поэтому вывод следует считать сопоставлением независимых измерений, а не цитатой из одной работы.

Добавим сигналы приборов: таймер лампы, сигнал апекслокатора, писк эндомотора при достижении заданного момента — короткие звуки, накладывающиеся на речь и близкие к ней по частоте.

Кто и как говорит на приёме

Врач говорит в трёх разных режимах, и на слух они плохо различимы:

  • *Пациенту* — обычная громкость, бытовые формулировки: «сейчас будет прохладно», «поднимите руку, если что-то почувствуете».
  • *Ассистенту* — короткие команды, часто на полуслове: «воздух», «матрицу», «два-два», «шприц».
  • *Вслух для фиксации* — клинические находки, номера зубов, состояние: «шестёрка снизу справа, полость по жевательной, зондирование безболезненно».

Все три потока идут вперемешку в пределах одной минуты, и только третий относится к медицинской записи.

Что происходит с речью врача во время работы. Врач наклонён к пациенту, голова опущена, лицо направлено в полость рта. Между ним и любым микрофоном оказывается его же корпус. Речь в этот момент приглушена маской, короче обычной, содержит незаконченные конструкции — «здесь у нас… ага… нет, дальше» — и прерывается на действие, возобновляясь через несколько секунд с середины мысли.

Влияние маски измерено. Все типы масок ослабляют частоты выше 1 кГц, ниже 1 кГц эффект незначителен, а максимум ослабления приходится на область выше 4 кГц. Для хирургической маски ослабление в полосе 2–16 кГц составляет около 2,8–3,6 дБ, для респиратора N95 — 5,4–5,7 дБ, для лицевого щитка — до 8–13,7 дБ (Corey et al., Journal of the Acoustical Society of America, 2020). То есть маска бьёт по тому же диапазону, что и турбина.

Три-четыре децибела сами по себе немного. Но с шумом они действуют не по отдельности. В эксперименте на разборчивость речи человеком при отношении сигнал/шум +13 дБ разница между речью в маске и без неё почти отсутствовала (94,3% против 93,5% для хирургической маски), а при +3 дБ разрыв стал разительным: 45,2% без маски против 34,6% в респираторе N95 и 27,0% в плотной тканевой маске (Toscano & Toscano, PLOS ONE, 2021). Маска и шум перемножаются, а не складываются.

Ассистент говорит короткими репликами, часто одновременно с врачом: подтверждает, уточняет, проговаривает вслух то, что записывает. Работа в четыре руки предполагает наложение реплик — это не помеха, а нормальный режим взаимодействия.

Пациент находится в положении, при котором говорить трудно или невозможно: лёжа, с открытым ртом, с ретрактором, валиками, коффердамом или слюноотсосом. Его ответы односложны, невнятны из-за анестезии, заменяются жестами, а на этапах с изоляцией физически невозможны.

Отсюда следствие: самая клинически ценная реплика пациента — жалоба — звучит один раз, в начале приёма, до всего остального. Дальше диалога в привычном смысле нет.

Особенности профессиональной речи

Это отдельный язык, а не медицинская лексика в общем смысле.

Диктовка зубной формулы. Один зуб произносится минимум шестью способами: «четыре-шесть», «сорок шестой», «шестёрка снизу справа», «нижняя правая шестёрка», «первый моляр справа внизу», «четыре точка шесть». Квадрант в серии называется один раз, дальше идут только порядковые номера: «верх справа: шестёрка — пломба, семёрка — кариес, восьмёрка отсутствует». Тема разобрана отдельно: как стоматологи произносят зубную формулу вслух.

Поверхности и полости. «Полость по жевательной», «МОД» (произносится и как слово «мод», и как «эм-о-дэ»), «мезиально-окклюзионная», «пришеечная», «второй класс по Блэку», «вестибулярно».

Данные обследования короткими блоками. «Перкуссия отрицательная». «Зондирование по дну болезненно». «Холод — кратковременная реакция, боль проходит сразу». «Подвижность первой степени». «Карман пять миллиметров с дистальной». «Рецессия два миллиметра».

Пародонтологическое зондирование — предельный случай: шесть значений на зуб, серии без пауз, «три-два-три, два-два-три», до полутора сотен чисел подряд.

Эндодонтия. «Три канала: медиально-щёчный, медиально-язычный, дистальный». «Рабочая длина двадцать один, двадцать один и двадцать три». «Прошёл двадцать пятым по сороковому». «Апекслокатор показывает ноль-пять». Здесь числа идут потоком и обозначают разное: длину в миллиметрах, размер инструмента, конусность, номер зуба.

Материалы и препараты. «Стеклоиономер под композит». «Артикаин четыре процента с адреналином один к двухсоттысячной, полтора карпула». «Гипохлорит три процента». «Кальций гидроксид временно на две недели».

Диагнозы — в двух вариантах сразу. Клинически: «кариес дентина», «хронический апикальный периодонтит». Кодом: «К02.1», «К04.5». Часто одно и то же в одной фразе.

Команды ассистенту, не относящиеся к записи. «Воздух», «сухо», «свет», «матрицу», «клин», «слюноотсос ниже», «зеркало», «карпулу», «двадцать пятый».

Различия по специальностям

Терапия. Смешанный приём: разговорное начало, затем длительная работа под шум с короткими фиксирующими репликами, разговорное завершение. Значительная часть речи приходится на шумные интервалы.

Хирургия. Самый бессловесный приём. После сбора анамнеза и разъяснений врач работает почти молча: короткие команды ассистенту, редкие комментарии. При этом именно хирургическая запись требует максимальной подробности — доступ, объём вмешательства, интраоперационные находки, характер кости, ушивание. Разрыв между объёмом сказанного и объёмом того, что должно быть записано, здесь максимальный.

Ортопедия. Приём растянут на серию визитов. Много обсуждения с пациентом: конструкция, материал, цвет, сроки, стоимость. Разговорная часть велика, но значительная её доля — согласование, а не клиника. Отдельный слой — общение с зуботехнической лабораторией, к записи в карте отношения не имеющее.

Ортодонтия. Первичная консультация — длинный связный разговор в тишине: диагностика, план, альтернативы, сроки, стоимость. Последующие визиты, наоборот, короткие и почти безмолвные: активация, замена дуги, контроль. Крайние точки диапазона внутри одной специальности.

Опубликованных замеров доли разговорного времени по стоматологическим специальностям найти не удалось, поэтому процентов мы не приводим.

Что должно быть записано, а что нет

На приёме звучит существенно больше, чем должно попасть в медицинскую карту. Разграничение проходит не по громкости и не по длине реплики.

Относится к медицинской документации:

  • жалобы в формулировке пациента: «болит, когда пью холодное, отпускает сразу»;
  • анамнез, включая отрицания: «аллергии на анестетики нет», «гипертонии нет»;
  • данные объективного осмотра и результаты проб;
  • номера зубов и локализация находок;
  • диагноз, произнесённый врачом;
  • выполненные манипуляции, материалы, дозировки, размеры;
  • факт информирования пациента и его решение: «объяснил про два варианта, пациент выбрал сохранение зуба»;
  • рекомендации и срок следующего визита;
  • отказ пациента от предложенного вмешательства.

Не относится:

  • команды ассистенту: «воздух», «матрицу», «свет ниже»;
  • бытовое общение: погода, отпуск, дети, пробки;
  • реплики успокоения: «потерпите чуть-чуть», «уже заканчиваем»;
  • организационные разговоры: «запишитесь у администратора», «оплата на ресепшене»;
  • обсуждение расписания, звонки, реплики вошедшего коллеги;
  • размышления врача вслух, не приведшие к решению: «может, сюда вкладку… нет, реставрируем».

Три категории требуют особой осторожности. Предположения, произнесённые вслух, но не ставшие диагнозом. Сведения о третьих лицах, которые пациент упоминает в разговоре: сведения о нём самом составляют врачебную тайну (статья 13 Федерального закона от 21.11.2011 № 323-ФЗ), а сведения о его родственниках в его карте не нужны вовсе. Личные обстоятельства пациента, рассказанные в порядке беседы и не имеющие клинического значения.

Почему приблизительная точность здесь неприемлема

Обычный текст обладает избыточностью: искажённое слово видно и восстанавливается по смыслу фразы. Клинические данные избыточности не имеют. Ошибка в них выглядит как корректная запись.

Искажённый номер зуба. «16» вместо «26» — запись о лечении другого зуба. Грамматически безупречная, на глаз не вычитывается. Расхождение обнаружится позже — при сопоставлении карты с прицельным снимком, планом лечения, согласием и актом, причём обнаружит его не тот, кто ошибся.

Потерянное отрицание в анамнезе. «Аллергии на анестетики нет» и «аллергия на анестетики» различаются одним словом и означают противоположное. Отрицания — самый уязвимый элемент: они короткие, безударные и произносятся скороговоркой.

Неверная дозировка. «Полтора карпула» и «пять карпул», «один к двухсоттысячной» и «один к сотысячной» — искажение, превращающее корректную запись в описание превышения дозы. Записанное значение становится единственным свидетельством того, сколько препарата введено.

Неверное название препарата или материала. Меняет описание вмешательства и вступает в противоречие со складским учётом и актом выполненных работ.

Общий принцип: потерянный фрагмент врач заметит при проверке, потому что помнит приём; искажённый фрагмент выглядит нормально и потому проходит мимо внимания.

Что из этого следует для техники

Теперь вторая половина — как перечисленные свойства кабинета и речи выглядят со стороны инженерной задачи.

Распознавание в шуме

Общая закономерность измерена. При тестировании современных моделей на разных типах шума большинство удерживает приемлемое качество примерно до 10 дБ отношения сигнал/шум, а ниже деградирует резко: при 0 дБ в шуме кафе лучшие модели дают около 35% ошибочных слов, а более лёгкие модели превышают 50% (Katkov et al., Journal on Audio, Speech, and Music Processing, 2026).

Отдельно измерено влияние маски на автоматическое распознавание: на дистанции 0,6 м в шуме средняя потеря точности составила около 10 процентных пунктов, причём падение точности сильнее всего коррелировало со звукоизоляцией маски на частоте 3,15 кГц — коэффициент корреляции 0,943 (Li et al., Applied Sciences, 2024). Исследование проводилось на мандаринском языке, поэтому переносить абсолютные значения на русскую речь нельзя, но механизм показателен: страдает именно высокочастотная часть, отвечающая за согласные.

Разделение говорящих

Задача называется диаризацией: определить, кто и когда говорил. Метрика — доля времени с ошибочной атрибуцией.

На чистых записях многосторонних разговоров современные системы с открытым кодом дают около 9%. В шумном помещении с перекрывающимися репликами тот же класс систем «из коробки» даёт от 27% до 65%; шумоподавление улучшает картину, но не радикально — и, что важно, снижая пропуски, оно увеличивает ложные срабатывания (Khan et al., 2025). Это размен, а не бесплатное улучшение.

Причина трудности принципиальная: кластеризующие системы по построению приписывают каждому отрезку одного говорящего, поэтому перекрытая речь уходит в пропуски. Стоматологический приём с постоянным наложением реплик врача и ассистента — как раз худший случай.

Числа как отдельный контур

Обычное распознавание опирается на языковую модель: она оценивает вероятность последовательности слов и вытягивает искажённое слово по контексту. На числах механизм отключается — контекста, восстанавливающего «двадцать шесть» из «двадцать семь», не существует.

Разрыв измерим. Одна и та же система показывала 8,7% ошибочных слов на обычной речи и лишь 36,3% правильных распознаваний денежных сумм; авторы прямо связывают это с тем, что ожидаемая форма записи числа зависит от контекста, а одна и та же звуковая последовательность требует разной интерпретации (Huber & Waibel, arXiv:2408.00004).

Практический вывод: числовая часть стоматологической речи не может обрабатываться тем же контуром, что связный текст. Ей нужен детерминированный разбор с явными правилами — знание структуры зубной формулы, допустимых диапазонов номеров, того, какие сочетания невозможны в принципе, и того, что «шесть» в позиции глубины кармана и «шестёрка» в позиции номера зуба — разные сущности.

Главный риск — не пропуск, а достройка

Это место, где расходятся честный инструмент и опасный.

Большие языковые модели при неуверенности склонны не оставлять пробел, а порождать правдоподобный текст. Явление документировано. В работе, представленной на конференции ACM FAccT 2024, по 13 140 аудиофрагментам около 1,4% транскрипций содержали целиком выдуманные фразы, причём 38% этих выдумок несли явный вред: несуществующие имена и родственные связи, приписанные состояния здоровья, фиктивные ссылки (Koenecke et al., FAccT '24).

Критически важен установленный там же механизм: ключевым предиктором выдумки оказалась доля пауз в записи. У говорящих с нарушениями речи, где паузы занимали 41% времени против 15% в контроле, частота выдумок была заметно выше. Стоматологический приём — ровно такой профиль: речь прерывиста, паузы длинные и заполнены шумом инструмента. На чисто неречевом аудио частота выдумок в отдельном исследовании достигала 40,3%, причём среди самых частых выдуманных фраз оказались следы обучающих данных вроде «спасибо за просмотр» (Barański et al., ICASSP 2025).

Есть и прямое измерение на клиническом материале: при подаче заведомо неправдоподобных лабораторных значений модель сохранила оба значения без изменений в 60,1% случаев, то есть не сигнализировала об аномалии (Wang et al., npj Digital Medicine, 2025). В другой работе выдумки обнаружились в 31% сгенерированных клинических записей против 20% в записях, написанных врачами (Palm et al., Frontiers in Artificial Intelligence, 2025).

Отсюда требование, которое должно быть заложено в архитектуру, а не в инструкцию пользователя: при неуверенности инструмент обязан оставить пропуск и пометить место, а не подставить правдоподобное значение.

Почему на оценку уверенности нельзя полагаться в одиночку

Системы распознавания выдают для каждого фрагмента оценку уверенности, и её логично использовать для подсветки сомнительных мест на экране проверки. Ограничение в том, что в шуме модели систематически переуверенны: при низком отношении сигнал/шум 10–20% фрагментов предсказываются неверно с уверенностью выше 0,7 (Huo et al., arXiv:2509.07195). То есть именно там, где помощь нужнее всего, оценка врёт.

Практически это означает, что подсветка должна опираться не только на неё: помогает связывание каждого пункта черновика с фрагментом исходной записи, отдельная обработка чисел и правила, знающие предметную область.

Почему бытовые голосовые помощники здесь неприменимы

Разброс качества между сценариями огромен. Систематический обзор 29 исследований дал долю ошибочных слов 8,7% при контролируемой диктовке и свыше 50% в разговорных многоголосых сценариях (Ng et al., BMC Medical Informatics and Decision Making, 2025). Универсальные системы обучены на бытовой речи, где числа редки и некритичны, а терминология отсутствует.

И одна цифра, которая объясняет, зачем нужен врач

В исследовании 144 врачей двух систем здравоохранения необработанный вывод системы распознавания содержал 7,4 ошибки на 100 слов. После правки профессиональным транскрипционистом — 0,4. После проверки и подписи врача — 0,3, то есть примерно одно неверное слово на триста (Zhou et al., JAMA Network Open, 2018).

Порядок ошибок падает более чем в двадцать раз, и падает именно на этапе врачебной вычитки. Это единственный элемент схемы с доказанной эффективностью — и потому он не может быть необязательным.

Выводы

  1. Шум в стоматологическом кабинете не фоновый, а совпадающий по времени с клинически значимой речью, и по частоте он конкурирует с ней: пик шума турбины приходится примерно на 4500 Гц, где сосредоточена значительная часть разборчивости и энергия свистящих согласных.
  2. Маска ослабляет тот же диапазон — выше 1 кГц с максимумом выше 4 кГц; с шумом её эффект перемножается, а не складывается.
  3. Речь врача разделена на три адресата — пациент, ассистент, документ — и на слух эти потоки не различаются.
  4. Пациент физически ограничен в возможности говорить: его самая ценная реплика звучит один раз, до начала работы.
  5. Профессиональная речь насыщена числами, обозначающими разное, и не имеет единого устного стандарта; числа не восстанавливаются контекстом и требуют отдельного детерминированного разбора.
  6. Главный риск — не пропуск, а правдоподобная достройка текста при неуверенности; явление измерено в рецензируемых публикациях, и провоцируют его именно паузы и шум, то есть характерный профиль стоматологической записи.
  7. Требование к точности здесь несимметрично обычному тексту: искажённое значение опаснее потерянного, потому что не заметно при проверке. Отсюда единственно безопасное поведение инструмента — оставлять пропуск и помечать место.

О проекте

DentyScribe построен вокруг перечисленных ограничений, а не вопреки им: числовая часть и зубная формула обрабатываются отдельным детерминированным контуром, при неуверенности место остаётся пустым и помеченным, а каждый пункт черновика связан с фрагментом исходной записи, чтобы проверка занимала минуты. Врач проверяет, правит и подтверждает — без подтверждения врача документа не существует. Все клинические решения принимает врач. Запись ведётся только с согласия пациента, данные хранятся на серверах в России.

Подключить клинику можно уже сейчас.

Оставить заявку на подключение


Источники

  1. Otoum A.H. et al. Measurement of Noise Levels of Dental Equipment used in the Dental Clinics and Laboratory. Journal of the Royal Medical Services, 2021.
  2. Antoniadou M., Tziovara P., Konstantopoulou S. Evaluation of Noise Levels in a University Dental Clinic. Applied Sciences, 2023;13(19):10869.
  3. Yamada T., Nozaki K., Hayashi M., Kuwano S. Sound Environment during Dental Treatment in Relation to COVID-19 Pandemic. Acoustics, 2023;5(4):56.
  4. Lee W., Kwon H.-B. Vibroacoustic analysis of dental air turbine noise. BDJ Open, 2022;8:27.
  5. Barek S., Adam O., Motsch J.F. Large band spectral analysis and harmful risks of dental turbines. Clinical Oral Investigations, 1999;3:49–54.
  6. ANSI/ASA S3.5-1997 (R2020). Methods for Calculation of the Speech Intelligibility Index.
  7. Corey R.M., Jones U., Singer A.C. Acoustic effects of medical, cloth, and transparent face masks on speech signals. Journal of the Acoustical Society of America, 2020;148(4):2371–2375.
  8. Toscano J.C., Toscano C.M. Effects of face masks on speech recognition in multi-talker babble noise. PLOS ONE, 2021.
  9. Li X., Ni K., Huang Y. Effect of Face Masks on Automatic Speech Recognition Accuracy for Mandarin. Applied Sciences, 2024;14(8):3273.
  10. Katkov S., Liotta A., Vietti A. Speech recognition in adverse conditions: synthetic transformations and real environmental noise. Journal on Audio, Speech, and Music Processing, 2026;2026(1):28.
  11. Khan et al. Multi-Stage Speaker Diarization for Noisy Classrooms. arXiv:2505.10879, 2025.
  12. Huber C., Waibel A. Handling Numeric Expressions in Automatic Speech Recognition. arXiv:2408.00004.
  13. Koenecke A., Choi A.S.G., Mei K.X., Schellmann H., Sloane M. Careless Whisper: Speech-to-Text Hallucination Harms. ACM FAccT '24.
  14. Barański M. et al. Investigation of Whisper ASR Hallucinations Induced by Non-Speech Audio. ICASSP 2025, arXiv:2501.11378.
  15. Wang H., Yang R., Alwakeel M. et al. An evaluation framework for ambient digital scribing tools in clinical applications. npj Digital Medicine, 2025;8:358.
  16. Palm et al. Assessing the quality of AI-generated clinical notes: validated evaluation of a large language model ambient scribe. Frontiers in Artificial Intelligence, 2025.
  17. Huo M., Zhang Y., Tang Y. Identifying and Calibrating Overconfidence in Noisy Speech Recognition. arXiv:2509.07195, 2025.
  18. Ng Q.X. et al. Evaluating the performance of artificial intelligence-based speech recognition for clinical documentation: a systematic review. BMC Medical Informatics and Decision Making, 2025;25:236.
  19. Zhou L., Blackley S.V., Kowalski L. et al. Analysis of Errors in Dictated Clinical Documents Assisted by Speech Recognition Software and Professional Transcriptionists. JAMA Network Open, 2018;1(3):e180530.
  20. Федеральный закон от 21.11.2011 № 323-ФЗ — ст. 13.
  21. Директива 2003/10/EC — пороговые значения экспозиции шума на рабочем месте.