part 1 (694716), страница 2
Текст из файла (страница 2)
Системы VHC -200 применяются для управления четырехшиин-дельными сверлильными станками и лазерами, iопользующимися для обработки полупроводников и сверхтвердых материалов, а также для управления токарными станками. Кроме того, эта система применяется для взаимодействуя с системой искусственного интеллекта и управления голосом.
Данная система используется для технической диагностики компрессоров холодильных установок и при распределении посылок.про-ходящих по конвейеру [П9].
й[П7] описывается использование одной из систем фирмы Threshold Technology для автоматического ввода голосом по телефону гидрографических данных исследования морских акваторий.
Еще одной американской промышленной системой автоматического распознавания изолированных слов является v/RS [l40] . Система предназначена для практического использования в армии и обеспечивает прямую двустороннюю связь между персоналом на передней линии фронта и армейскими информационными системами, использующими автоматическое распознавание слов, идентификацию диктора и его верификацию (подтверждение, тот ли человек разговаривает с системой).
Мини-ЭВМ этой армейской системы полностью обеспечивает автоматизированную обработку сигналов в реальном времени, трансляцию (т.е. автоматическое распознавание) сообщения и синтезированный речевой ответ на три сети связи одновременно для любых трех из 64 пользователей. Рабочий словарь системы 250 слов. Полевой оператор-разведчик оснащ'ен переносным блоком записи донесений для точной записи тактических данных и возможного ввода их по радио или телефонным линиям в армейскую тактическую информационную систему. Для удаленного оператора используются передатчики с частотной модуляцией. Система распознавания слов таз, воспринимая дискретные речевые сообщения (фразы, произносимые в жестком формате пословно), "подсказывает" оператору на каждом шаге, какого рода информацию ждет она от него далее, предварительно подтвердив правильную запись предыцущего донесения.
Жесткий формат фраз определяется специализированным языком точного описания тактических условий в поле деятельности оператора и управления артиллерийским огнем.
Для голосового ответа в «'/КЗ используется программно-управляемый звуковой синтезатор фирмы Vocal Interf;ice Division, который позволяет получать цепочки фонем и фонемоподобных звуков в соответствии со смыслом речевого ответа; при этом обеспечивается необходимая модуляция основного тона для большей естественности звучания. Если какой-либо оператор хочет ввести в армейскую тактическую информационную систему донесение после того, как wrs обучалась его речевьм характеристикам, он должен обнаружить канал связи, а затем ввести шесть слов, представляющих' шифр (код) используемой сети, код пользователя и слова завершения.
Хотя система распознавания способна работать автоматически, на стороне v/RS всегда присутствует оператор. Он следит за экраном буквенно-цифрового дисплея, где отражаются донесения,поступающие с трех линий связи. По мере распознавания донесений появляется их буквенный текст. Если донесения полностью удовлетворяют оператора, он передает их для исполнения (и для получения "твердой копии" на бумаге), нажимая на пульте соответствующую клавишу. Оператор может с пульта отредактировать любое . донесение, прежде чем выдать его для исполнения. Оператор может также с пульта управления в тобой момент связаться по радио или телефонному каналу с каждым разведчиком-пользователем (или со всеми сразу). Если при распознавании донесения, поступающего от пользователя, возникают трудности, то оператор должен сделать вое. чтобы донесение было принято. Для этого он может,например,переучить систему на голос этого пользователя.
Автономный блок системы, предназначенный для связи с пользователями, возбуждается без вмешательства оператора при одном из трех "условий":
а) распознано слово "оператор";
б) последовательно прошло неверное распознание двух слов подряд;
в) во время трансляции шифра диктор идентифицирован как злоумышленник .
Точность распознавания слов превышает 95% при передаче речи по несекретной радиолинии с отношением сигнад/шум, равным 10 дБ. При использовании более совершенной радиолинии точность,трансляции донесения достигала 9'?%.
Зак.480
В 1977г. Оыло выпущено устройство Heuristics $299 Speuchlab, требующее ддя реализации системы распознавания дополнительной ЭВМ. Точность распознавания слов в системах, использующих это устройство, была относительно низкой (около 90%), однако из-за невысокой стоимости оно оказалось в настоящее время наиболее распространенным. В 19УО г. этой же фирмой была выпущена система 7000, соединенная со стандартными видеотерминальными RS -232 [903 • Система, выпускаемая в автономном корпусе, включает цифровой спектроанализатор и блок распознавания. Она может быть обучена распознаванию 64 слов или фраз, длительность аву-чания каждой из которых до 3 с.
Система 7000 дает возможность вводить информацию голосом в ЭВМ, не набирая ее на клавиатуре видеотерминала, однако позволяет также пользоваться клавиатурой (по очереди или одновременно).
В [69J сообщается, что фирмой Interstate Electronics Inc. выпускается сходный по техническим характеристикам с системой 7000 одноплатный модуль распознавания речи VRK - Voice recognition module, реализованный на базе микропроцессора и представляющий "интеллектуальным" терминалам и небольшим вычислительным системам средства автоматического речевого ввода. Отмечается, что 'это устройство обеспечивает распознавания более 99% при вариантах с объемом словаря в 40, 70 или 100 слов. На входе устройства используется 16-канальный аналоговый спектроанализатор, информация с которого далее преобразуется в цифровую форму и уплотняется до размера эталонов, хранящихся в памяти van .В настоящее время фирма выпускает одноплатное устройство распознавания слов vrt-зоо, которое полностью позволяет дублировать клавишную систему управления видеоматериалом.
В [45J рассматриваются вопросы использования устройств автоматического распознавания и синтеза речи в системах военного назначения. Указывается, что в настоящее время автоматический анализ и синтез речи испытывается в тренажерах для подготовки специалистов (например, летчиков или диспетчеров управления воздушным движением), а также в устройствах ддя автоматизации ввода данных в ЭВМ при дешифрации аэрофотоснимков в процессе составления карт местности. Предполагается, что в перспективе устройства распознавания речи будут использоваться для ввода команд в систему оружия или в систему управления полетом.О необходимости заполнить пробел между относительно простыми,, настраивающимися на диктора и словарь, промышленными устройствами автоматического распознавания речи и громоздкими экспериментальными сис-
10
темами понимания речи, основанными на моделях естественных языков, Ли и Шоуп писали еще в [ 144] .
Одной из самых совершенных коммерческих систем автоматического распознавания речи является система распознавания изолированных слов и слитной речи CSRS японской фирмы NEC [47] . Технологической базой этой системы служит микропроцессорная техника. (В системе используются пять микропроцессоров.) CSRS обеспечивает надежное автоматическое распознавание в действительно шумных средах ^до 90 дБ) с 0,2% ошибок и 0,7^, отказов на материале 120 слов. Система csrs , как и vip -100 и wrs, является адаптивной, настраиваемой на диктора и словарь. При распознавании слитно произносимых словосочетаний (до пяти слов одновре-* менно) система использует методику распознавания, основанную на так называемом двухступенчатом согласовании эталонных реализации и входной последовательности словосочетаний с использованием аи-г 'итмов динамического программирования. Блок автоматического распознавания включает цифровой анализатор спектра, преобразующий входной сигнал, который поступает с АЦП в 46-мерные векторы через каждые 18 мс, память эталонных реализации,позволяющих хранить до 120 эталонов слов, процессор динамического программирования , представляющий собой мультимикропроцессорную ЭВМ, и интерфейсную микроЭВМ, обеспечивающую управление всей системой.gsrs осуществляет распознавание практически в реальном масштабе времени. Систему можно приспособить, несколько изменив программу динамического согласования эталонов и выходного высказывания, для распознавания 1000 слов, произносимых изолированно.
На выставке в Москве (декабрь 1976 г.) демонстрировалась система gsrs , позволяющая подключать к одному блоку двух пользователей, работающих одновременно в режиме диалога с csrs [29]» За счет более совершенного распознавания система обеспечивает более простое обучение, допуская одно- или двукратное произнесение каждого слова.
В [16] рассматривается отечественная система,предназначенная для распознавания набора слов, число которых около 400.Сяо-варь представлен в памяти фонемными кодами, что позволяет после этапа подстройки системы -юд диктора (сводящейся к однократному произнесению специального словаря, содержащего фонемы русского языка в различных словосочетаниях) заменять,корректировать и пополнять словарь без участия диктора. В системе используется'пять параметров речевого сигнала, которые служат цля распознавания слов - логарифм полной энергии сигнала и логарифмы отношения • Полной энергии сигнала к энергиям сигнала в четырех полосах.
II
Из-за использования относительно медленной машины и чисто программной реализации алгоритмов анализа сигнала время обработки около I мин на слово, время принятия решения ~ W/8 с, где И - объем словаря.
В более поздней работе этого же коллектива рассматриваются системы признаков, основанные на модеси линейного предсказания С 17] и психоакустическом эффекте маскировки более схабых составляющих речевого сигнала более сильными.При использовании данного подхода точность распознавания изолированных слов для одного диктора составила при лексиконе из 100 слов - 97%,а при лексиконе из 300 первых слов русского частотного словаря - 94^.
В Институте кибернетики АН УССР в 1977 г. разработана адаптивная система распознавания слов, работающая в реальном масштабе времени [1б] . Система создана на основе ЭВМ БЭСМ-6, но может быть реализована на других ЭВМ или в специализированном устройстве на микропроцессорах. В процессе предварительной обработки речевого сигнала вычисляется последовательность 48-разрядных двоичных кодов, каждый из которых определяет знак производной по частоте амплитудного спектра речи, вычисленных на участках в 15 мс. Обработка введенного речевого сигнала длительностью I с происходит за 0,3 с, время распознавания одного слова для словаря из 100 слов - не более I с. Точность распознавания словаря из 500 слов - 98%. Методика принятия решения в системе более подробно рассмотрена в С20].
В [21] описывается разработанная в ИК АН УССР система распознавания речи, настроенная на голос нескольких дикторов и обеспечивающая надежность распознавания изолированных слов около 98^ для словаря из 500 слов.
Интересная адаптивная система распознавания изолированных слов, использующая параметры клиппироваяного речевого сигнала, разработана Н.П.Бусленко, В.В. Деевым и Г.Д.Фроловым [8].В этой системе для формирования эталонов и автоматического распознавания предложен оригинальный математический подход к анализу последовательности чисел, соответствующей интервалам между нулевыми перечислениями сигнала. Обобщенные эталоны формируются после нескольких for 2 до Ь) произнесений слова. При распознавании происходит сравнение поступившего на вход слова с этими эталонами. В системе реализован речевой ответ, также основанный на формировании клиппированного речевого сигнала. Ццеи,рассмотренные в [в] , нашли свое дальнейшее развитие в системе, реализованной на мини-ЭВМ.
12
В ряде кибернетических систем массового пользования целесообразно использовать автоматический речевой ввод без предварительной настройки на голос оператора. В таких системах распознавание должно базироваться на универсальных фонологических правилах, а в дальнейшем - на использовании синтаксиса и семантики естественных языков. Другой путь построения неадаптивных систем распознавания речи - сбор эталонных реализации от большого (до 500) числа дикторов, кластеризация эталонов и использование того факта, что каждый новый диктор произносит слова так, как этр делал один из тех дикторов, который участвовал в обучении системы распознавания. В настоящее время не достигнуто высокой точности распознавания слов в неадаптивных системах (кроме системы Dialog Systems , где весьма небольшой словарь и используются эталоны, полученные от 500 дикторов). Однако исследования, проведенные в этой области, а также феномен человека, воспринимающего слитную речь произвольного диктора без предварительной настройки на его голос, доказывают, что технические средства,направленные на распознавание речи любого пользователя, несомненно, будут созданы.