Реферат: Актуальность темы


Общая характеристика работы

Актуальность темы
Значительные успехи в области развития вычислительной техники вынуждают разработчиков создавать более совершенные средства взаимодействия с машинами. Преимущества речевого диалога перед традиционными средствами общения исследованы достаточно давно и многократно описаны в литературе. Привлекательность речевого общения, достижения в области распознавания речи, а также сопутствующее им развитие и удешевление электронно-вычислительной микропроцессорной техники в последнее время привели к тому, что сфера внедрения систем распознавания речи (СРР) существенно расширяется, захватывая различные отрасли производственной, административной, и даже бытовой деятельности.

Речевой канал управления техническими средствами и вычислительными машинами позволяет освободить руки, разгрузить зрение, обеспечить независимость от механических вибраций и условий освещения. Для управления сложными техническими системами человеку приходится осваивать, образно выражаясь, "язык интерфейса", на что тратится время. Поэтому требование эргономичности при разработке человеко-машинных интерфейсов подразумевает обеспечение наиболее естественных форм взаимодействия, каковой, очевидно, является речевой диалог. Кроме того, речевой ввод информации может играть роль дополнительного канала управления, который оказывается во многих ситуациях незаменимым, особенно в случаях, связанных с ограниченной подвижностью человека-оператора.

21-ый век со всей очевидностью заявил о себе, как эпоха "информационного взрыва". Несомненно, на этом этапе технического прогресса, одними из приоритетных становятся направления, связанные с развитием технологий интеллектуальных форм взаимодействия человека и информационно вычислительных систем. Постоянное усложнение техники приводит к тому, что каждое элементарное управляющее воздействие становится всё более содержательным, однако обеспечение необходимого разнообразия и гибкости в управлении приведет в этом случае к существенному усложнению человеко-машинного интерфейса. Возникает противоречие, которое может быть успешно разрешено благодаря организации речевого управления, так как формулирование команд на естественном языке обладает необходимой гибкостью и содержательностью одновременно.

Есть и другие преимущества речевого общения, число которых будет со временем увеличиваться по причине всё большей интеграции вычислительной техники в повседневную жизнь человека. Например, благодаря системам речевого общения, управление справочными службами, традиционно осуществляемое человеком-оператором, можно практически полностью переложить на вычислительную технику.

Несмотря на многолетнюю историю и значительные достижения в области распознавания речи, в полном объеме задача остаётся нерешенной.

Вопросы, касающиеся проблем дикторонезависимости и помехоустойчивости, остаются наиболее актуальными в настоящее время. Современные системы распознавания речи, которые позиционируются как дикторонезависимые, осуществляют распознавание изолированных слов ограниченного словаря (до 500 слов) с надёжностью в акустически благоприятных условиях достигающей 95% (на практике, заявленные производителями показатели, часто оказываются преувеличенными). Системы распознавания слитной речи, как правило, требуют кропотливой процедуры настройки на диктора, словарь может достигать больших размеров (200.000 слов). В таких системах единицей распознавания на акустико-фонетическом уровне обычно является фонемоподобные элементы языка (аллофоны, дифоны, фонемы и т. д.) или слоги. Надежность распознавания отдельных фонемоподобных элементов невысокая (редко достигает 80%), однако, их относительная малочисленность (по сравнению со словами или даже слогами), делает их привлекательными для использования, особенно в системах использующих настройку на нового диктора, которая реализуется путём изменения параметров эталонных речевых единиц (которых должно быть не много). Точность в таких системах во многом определяется эффективностью языковой подсистемы (верхних уровней анализа).

Проблема помехоустойчивости систем распознавания речи должна решаться по двум основным направлениям. С одной стороны, необходим комплекс мер, направленных на устранение помех, шумов и искажений, воздействующих на речевой сигнал. С другой стороны, учитывая практическую ограниченность мер по очистке речевых сигналов, но, не отменяя их, возникает потребность в методах выделения полезного речевого сигнала из акустической среды. Как правило, такие методы используют априорную информацию о полезном сигнале, и они продемонстрировали высокую эффективность в борьбе с различными типами помех. Однако требование наличия априорной информации существенно сужает область применения данных методов

Известно, что человек в процессе распознавания речи активно использует априорную информацию о полезном речевом сигнале. Это касается всех уровней системы, начиная с акустического и заканчивая верхними, интеллектуальными уровнями анализа. Использование априорной информации во многом определяет способность человека оставаться устойчивым к помехам различного рода.

В системах распознавания речи, процедура настройки на нового диктора должна моделировать процесс получения части априорной информации об акустико-фонетических свойствах речевого сигнала данного диктора. Верхние уровни анализа должны обеспечивать систему частью априорной информацией языкового, семантического и прагматического свойства. Поэтому актуальной задачей при создании систем распознавания речи является разработка алгоритмов повышения помехоустойчивости СРР, использующих априорную информацию на разных уровнях анализа.


^ Цель и задачи исследования

Разработка комплексного подхода, использующего нейросетевые технологии, направленного на повышение надёжности систем распознавания речи за счёт использования априорных сведений о распознаваемом речевом сигнале.


Достижение указанной цели требует решить следующие основные задачи исследования:


1. Изучение и анализ существующих подходов к решению задачи автоматического распознавания речи.

2. Разработка способа представления акустико-фонетической информации, учитывающего особенности восприятия речи человеком.

3. Разработка методов повышения помехоустойчивости СРР, использующих априорную информацию о некоторых свойствах полезного речевого сигнала.

4. Разработка нейросетевого алгоритма настройки системы распознавания речи на нового диктора.

5. Разработка структуры и определение параметров нейронной сети для задачи распознавания речевого сигнала.

6. Разработка методов использования языковых знаний для сокращения состава оперативного словаря СРР.

7. Практическая реализация и экспериментальное исследование разработанных методов и алгоритмов.


^ Объект и предмет исследования

Объектом исследования является речевой сигнал, а предметом исследования являются алгоритмы предобработки речевых сигналов, методы представления речевой и языковой информации, алгоритмы распознавания, алгоритмы обеспечения помехоустойчивости систем распознавания речи, методы настройки на диктора и способы реализации обозначенного в системах автоматического распознавания речи.


^ Методы исследования

Для решения поставленных задач применялась теория радиально-базисных нейронных сетей и сетей прямого распространения, а также сетей из нейроподобных элементов с временной суммацией сигналов. Обучение радиальных сетей осуществлялось методами кластерного анализа и градиентного спуска. Метод динамического программирования применялся для организации процедуры синхронизации речевых сигналов разных дикторов, а также для распознавания динамических последовательностей. Теория цифровой обработки речевых сигналов использовалась для первичной обработки акустической информации.


Основной научный результат диссертационной работы: разработана методика повышения надёжности систем распознавания речи, которая учитывает основные причины возникновения ошибок, и включает в себя комплекс научных и прикладных результатов, полученных в рамках данной диссертационной работы:


^ Научная новизна (научные результаты):

1. Разработан способ представления акустико-речевой информации в многомерном пространстве признаков (МПП), позволяющий использовать информацию об акустических особенностях голоса диктора в качестве априорной информации о свойствах распознаваемого речевого сигнала.

2. Разработана и экспериментально исследована новая радиально-базисная нейронная сеть встречного распространения (РБНС ВР), которая позволяет ассоциативно связывать между собой разные признаковые пространства.

3. Модифицирован алгоритм ассоциативного доступа к информации по ее фрагменту для динамических ассоциативных запоминающих устройств (ДАЗУ).


Прикладные результаты:

1. На основе предложенного способа представления акустико-фонетической информации разработан алгоритм обнаружения и компенсации помех в речевом сигнале.

2. Разработан алгоритм распознавания изолированно произносимых слов при помощи радиально-базисной сети, позволяющий выделять наиболее информативные признаки эталонов для реализации последующего механизма уточнения.

3. На основе радиально-базисной нейронной сети встречного распространения и предложенного способа представления акустико-фонетической информации разработан алгоритм настройки СРР на нового диктора.


^ Практическая значимость полученных результатов

1. Разработанные методы и алгоритмы использовались при разработке 8-ми разрядного микроконтроллера UNC81SVR01 (Unicore Microsystems), выполняющего в частности распознавание изолированно произносимых слов. Акт о внедрении прилагается.


2. Разработанные методы и алгоритмы использованы в ОАО “Концерн “РТИ Системы” в рамках проекта по разработке системы автоматического распознавания команд управления мобильным телефоном. Акт о внедрении прилагается.


3. Результаты диссертационной работы также использовались в НПИЦ "Микросистемы" при разработке речевого интерфейса для управления системой анализа текстовой информации TextAnalyst. Важной особенностью данного внедрения является то обстоятельство, что сама система TextAnalyst выступает в качестве модуля верхнеуровнего анализа при решении задачи распознавания речи.


Достоверность полученных научных результатов, выводов и рекомендаций диссертационной работы подтверждена результатами численного моделирования на вычислительной технике, экспериментальными исследованиями, а также соответствующими актами о внедрении результатов работы в разработку систем автоматического распознавания речи.


^ Апробация работ
еще рефераты
Еще работы по разное