Жанр: Учеба
Начала компьютерной лингвистики: учеб. пособие
...жно представить схемой, приведенной на рис.7.17.
Пертинентностью в ИПС называется соответствие текста документа фактической
информационной потребности, а релевантностью (смысловой или формальной) -
соответствие одного текста другому. Смысловая релевантность определяется
смысловым соответствием текстов, а формальная - соответствием поисковых
признаков.
Рис.7.16.
Рио.7.17
Различные ИПС объединяют следующие задачи:
анализ важности документов и их отбор;
создание поискового образа документов;
запись документов и поисковых образов документов на принятые в ИПС носители;
хранение документов и поисковых образов документов (ПОД);
выдача документов потребителям. Процесс функционирования Ш изображен на
рис.7.18.
Рис.7.18.
Классификация ИПС представлена на рис.7.19 и 7.20.
Документальные ИПС выдают адреса хранения поисковых образов, копия или оригиналы
документов, содержащих требуемую информацию,
Фактографические ИПС выдают непосредственно требуемые фактически данные.
Рис.7.19.
Рис.7.20.
Логические ИПС (или информационно-логические системы) выполняют при
необходимости логическую переработку информации.
Комплексные ИПС содержат отдельные элементы трех предыдущих типов.
Избирательное распределение информации производится по постоянным информационным
запросам. Поиск осуществляется в массиве вновь поступающих документов.
Ретроспективный информационный поиск выполняется по разовым запросам и состоит
в отыскании документов, в которых содержатся сведения по определенному вопросу.
Примером ИПЯзыка предкоординатного типа могут служить различные
классификационные системы (алфавитно-предметные, фасетные, иерархические ).
Наиболее распространены ИПЯ посткоординатного типа, использующие дескрипторный
язык.
Критерием соответствия называется совокупность правил, по которым определяется
степень формального соответствия между ПОД и ПП.
Критерий соответствия (КрС), выраженный через логические схемы, представляет
собой любое сочетание логических операций, И, ИЛИ, НЕ.
КрС, выраженные через аналитические функции, могут быть статистические и
векторные.
КрС, выраженный через "весовые" функции, определяет релевантность документа по
сумме "весовых" коэффициентов совпавших терминов запроса и документа (не менее
установленной пороговой величины).
Автоматическое индексирование предусматривает автоматизацию процессов
свертывания информации и перевод ее о естественного языка на ИПЯ. Степень
автоматизации определяется уровнем автоматизации процесса индексирования в ИПС.
Автоматическая классификация массивов подразумевает формирование массивов по
заранее заданным специальным признакам (меткам), содержащимся в ПОД, порождение
кланов документов на основе ассоциативных связей между терминами, входящими в
ПОД, и т.п.
Автоматический поиск определяется уровнем автоматизации сортировки данных и
сравнения ПОД с ПП.
Автоматическая выдача регулирует вид выдаваемой информации -номера документов,
библиографии или описания, ПОД и т.п.
Автоматическое управление характеризуется автоматизацией процессов обратной
связи и смены режимов поиска в ИПС.
7.5. Машинный перевод
Методы подхода к решению этой задачи можно подразделить на два типа: дедуктивный
и индуктивный. Первый основан на формальном описании семантики с использованием
модели "текст - смысл - текст", второй - на переводных соответствиях с
использованием модели "текст - текст".
При первом подходе стремятся получить полностью автоматизированный
высококачественный машинный перевод с максимальным использованием семантики
языка. Общую схему можно представить себе как переход от независимого анализа и
синтеза морфологического, синтаксического и семантического уровней к смыслу
текста.
Основой системы является, таким образом, переход от поверхностной структуры к
глубинной, от текста к его смыслу. Этот переход осуществляется с использованием
словарей входного и выходного языков, а также грамматических правил. Образец
обработки текста представлен на рис.7.21.
На первый блок поступает входная фраза, на вход каждого последующего - результат
работы предыдущего, на выходе последнего блока образуется перевод входной фразы.
Первая процедура выдает лексемы с приписанными морфологическими и словарными
характеристиками, вторая образует поверхностно-синтаксическое дерево, третья
формирует глубинно-синтаксическое дерево, четвертая подключается только при
наличии "несовместимостей" в предыдущем представлении. В результате на выходе
этапа анализа возникает базисная структура, по синтаксическим свойствам более
приближенная к выходной. Пятая процедура заменяет входные лексемы
соответствующими выходными эквивалентами, шестая формирует глубинносинтаксическое
представление выходной фразы, седьмая образует выходное
поверхностно-синтаксическое представление, восьмая устанавливает линейный
порядок лексем, девятая формирует выходную фразу.
На схеме просматривается аналогия между преобразованием информации в вопросноответных
системах и процедурами дедуктивного перевода. Разница заключается в
охвате предметной области.
Рис.7.21.
Второй подход рассматривает текст как избыточную многоуровневую систему, на
верхних ярусах которой находятся наиболее информативные лексические единицы, на
нижних - малоинформативные. Речь идет о бинарном переводе, при построении
которого структура входного и выходного языков объединяется в суперструктуру.
Перевод производится следующим образом: лексический перевод при помощи
автоматического словаря, семантический перевод, опирающийся на алгоритмы
устранения многозначности, составление грамматических алгоритмов.
Такая модель перевода имеет два состояния. Состояние генерации обеспечивает
настройку модели на условия ее работы: накопление словарей, алгоритмов анализа и
синтеза с ориентировкой на конкретную предметную область. В состоянии трансляции
система собственно работает над осуществлением перевода.
В модели различаются предметный и динамический компоненты. Предметный отвечает
на вопрос, что должно быть переведено, динамический - как осуществить перевод.
Предметный компонент включает лексику, грамматику и семантику, заданные
перечислением (предметный элемент), а также переводные соответствия, заданные
также перечислением.
Различают эквивалентные, вариантные и трансформационные (подключающие сложные
алгоритмы анализа, синтеза и межъязыковых преобразований) соответствия
(переводной элемент). Предметный элемент образует исходную структуру компонента,
на которую накладывается сеть переводного элемента.
Динамический компонент отвечает за конструирование выходного текста.
В режиме генерации предметный компонент опережает динамический.
Основной единицей перевода является предложение, однако границы перевода при
необходимости могут сужаться или расширяться.
Схема этого подхода представлена на рис.7.22.
Первая процедура занимается поиском входной цепочки символов в словаре,
приписыванием ей словарной информации, распознаванием оборотов, морфологическим
анализом словоформ, вторая на основе данных только входного текста разрешает
лексико-грамматическую омонимию, определяет синтаксическую функцию слов
предложения, ряд грамматических категорий - число, время и т.п. Третья процедура
описывает перевод одно- и многозначных слов, четвертая осуществляет
грамматическое и морфологическое оформление различных видов связей, определяет
грамматические категории, пятая обеспечивает трансформационные преобразования,
шестая синтезирует завершающие сложные грамматические формы.
Рис.7.22.
7.6. Интеллектные .робототехнические системы
Широков применение находят разработки в области вычислительной лингвистики и в
робототехнических системах
К интеллектным робототехничеоким системам относят системы третьего поколения,
распознающие объекты и юс состояния с использованием совокупности анализаторов и
определяющие действия, которые им следует выполнять, общаясь с человеком на
естественном языке. В таких системах развивается "языковой" подход к описанию
моделей проблемной среды. Модель рассматривается как некоторая семантическая
система, которая помимо синтаксических отношений между элементами должна
включать семантические отношения - смысловые связи, - позволять оперирование ими
при поиске пути достижения цели. Введение семантических отношений допускает
более сжатое представление описания модели и обеспечивает в какой-то степени
направленные смысловые преобразования информации.
Создание интеллектного робота предполагает решение следующих задач:
восприятие и распознавание окружающей среды;
обработка команд и принятие решения;
управление исполнительными механизмами;
обмен информацией между человеком и роботом.
Структуру организации интеллектного робота можно представить следующим образом
(рис.7.23).
Система формирования решений является центральной, управляющей. К ее функциям
относится:
принятие решения о том, что должна делать каждая система робота на определенном
отрезке времени;
проверка результатов этой деятельности;
выявление причин отклонений реальных результатов от ожидаемых и их анализ;
накопление новой информации об изменениях в среде для принятия новых решений.
Система представлена на рис.7.24.
Набор операторов представляет собой формальное описание моделей действий,
которые способен совершать робот. С их помощью одни состояния внешнего мира
преобразуются в другие (если выполняются условия применимости операторов).
Система восприятия информации обеспечивает связь робота с внешней средой,
представленной для робота в двух вариантах: внешний мир и человек-оператор.
Эффекторная система управляет действиями манипулятора и охвата в реальной среде.
Функциональное устройство системы восприятия информации и эффекторной системы
представлено на рис.7.25.
7.7. Экспертные снстемы
Рис. 7.23.
Результаты многолетних исследований в области искусственного интеллекта, включая
компьютерную лингвистику, нашли наиболее полное практическое применение в
экспертных системах. Под экспертной системой понимают автоматизированную
систему, в которой накоплен человеческий опыт в определенной области, например,
в политике, медицине, проектных работах, банковском деле и т.п.
Экспертные системы являются человеко-машинными системами, интеллектуальное ядро
которых составляют средства машинного восприятия, распознавания и понимания речи
из моделей естественного языка с моделями предметной области. Любая экспертная
система включает базу знаний, состоящую из правил (продукций), каждая из
которых по своей сути есть просто программа из одного оператора вида "если
(условие), то (действие)".
Последовательностью таких элементарных программ определяется набор разрешенных
преобразований от начального состояния до окончательного решения поставленной
задачи. Правила с помощью специальной программы могут добавляться, изменяться и
исключаться. Каждая продукция представлена отдельным модулем, который может
аппаратно исполняться отдельным процессором. Все продукции объединены
управляющей структурой.
Рис.7.24.
Рис. 7.25.
В экспертную систему входят эксперты и ряд программ (рис. 7.26). Знания
экспертов вводятся в экспертную систему и используются пользователями для
экспертизы в данной предметной области.
Вопросно-ответная программа обеспечивает возможность взаимодействия о
пользователем на естественном языке. Программа накопления знаний позволяет
пользователю пополнять и модифицировать базу знаний, объясняющая программа -
проверять ответ системы. Программа-интерпретатор интерпретирует продукции в
терминах предметной области. Исполнительная программа обеспечивает работу всей
системы.
Для большинства применений экспертных систем типично следующее:
выбор предметной области, где важная роль отводится эвристическим подходам;
выбор трудноформализуемых задач, требующих для своего решения такого количества
информации, что полная ее обработка трудоемка и утомительна для человека.
Одним из самых трудоемких и длительных процессов при создании экспертных систем
является процесс представления знаний и построение базы знаний. Эта
трудоемкость, в частности, связана с необходимостью структурирования знаний для
организации быстрого поиска.
При структурировании знаний отделяют факты из области применения системы
(декларативные знания) от методов решения проблемы (процедурные знания).
Декларативные знания поступают в систему от экспертов в данной области в
включают в себя аксиомы или правила, относящиеся к этим фактам. Для
представления декларативных знаний применяются в качестве языков системы
классификаций, семантические сети, фреймы:
Рис.7.26.
и т.д. Объединяет их возможность отражать функциональные, пространственные и
временные связи между объектами реальной действительности. Терминальными
элементами в этих языках выступают такие семантические категории, как "причина -
следствие", "правило - исключение", "множество - подмножество", "род - вид",
"общее - частное", "часть - целое" и т.д.
Процедурные знания относятся к процедурам обработки информации, к методам
логического вывода. Эти знания описывают последовательности действия, которые
должны быть совершены, и последовательности целей, которые должны быть
достигнуты. .
Процесс решения задачи может развиваться индуктивно от данных в направлении
поиска решений и дедуктивно, исходя из гипотез о возможном решении в направлении
поиска доказательств истинности принятых гипотез.
Пример. Какие повреждения сокращают выход бензина из бензонасоса в автомобиле?
Декларативное знание, введенное в экспертную систему: засорен клапан; загрязнен
фильтр; грязь под клапаном; повреждена мембрана насоса.
Если выход бензина из бензонасоса недостаточен, то, возможно, засорен впускной
шланг и т.д.
Возникает проблема ведения базы знаний. Необходимость изменения базы знаний с
течением времени очевидна. Она может быть вызвана устареванием существующих
знаний, появлением новых или дополнительных сведений. Согласование знаний и
отладка базы знаний выполняется на основе объяснительных механизмов экспертных
систем в рамках решений общей проблемы, получившей название "инженерии знаний".
При этом учитывается возможность 'согласования неточных и противоречащих знаний,
способность системы выдавать не единственное решение, а множество решений,
отражающее различные возможности при оценивании опорных ситуаций.
Для представления и ведения знаний в экспертных системах используются языки
обработки символьной информации ЛИСП, РЕФАЛ, ПРОЛОГ и т.д. Они удобны для
представления эвристических знаний и логического вывода. В них используется
единый декларативный формалиэм для представления знаний из предметной области и
процедурных знаний, включающих знания о самих процедурах.
Успех практической работы экспертных систем определяется их способностью к
развитию и обучению. Проблемно-независимую часть экспертных систем ("пустую
систему"), применение которой предполагается в любых предметных областях,
принято называть "инструментальной экспертной системой".
7.8. Гипертекстовая и гипермедиатехнология
• Гипертекстовая технология основана на такой машинной организации текстового
материала, при которой лексические единицы представлены не только линейной
последовательностью, но и ассоциативными связями между ними, определенными
знаниями о предметной области. Генерируя эти связи, можно в любом порядке
формировать другие линейные тексты. Знания о языке и предметной области тесно
взаимосвязаны. При достаточно обширном материале с большим количеством связей
возникает весьма сложное гипертекстовое пространство в виде своеобразной
семантической сети, многомерно отражающей предметную область.
По мере развития технических средств растет интерес к возможности расширения
гипертекста до более широкого понятия гипермедиа-информационной суперсферы, в
которой взаимосвязаны не только текстовые формы, но и речевые, графические,
вкусовые, обонятельные и осязательные ощущения в статике и динамике.
Система гипермедиа интегрирует процессы преобразования человеческих знаний с
информационной технологией, полным набором носителей и техническими средствами.
Гипертекстовые и гипермедиасистемы существенно уменьшают семантический разрыв
между человеком и машиной, повышают когнитивность машин и, увеличивают
возможности информатизации. Можно сказать, что гипермедиатехнологии являются
предтечей будущих кибернетических систем, обладающих сенсорными • возможностями
сравнимыми с человеческими, способных активно и автономно воздействовать на
окружающую среду, то есть по сути, открывают путь к машинной цивилизации.
7.9. Проблема системного описания языка
Как показывает анализ, разработка лингвистического обеспечения в значительной
мере отстает от имеющейся машинной базы, существующие у нас и за рубежом системы
диалогового типа (ПРИЗ, ДИСПУТ, ДИЛОС, СИНОПТИК и др.) обладают незначительным
словарем и ограниченными возможностями применения. Подобный дисбаланс
технической стороны и лингвистического обеспечения объясняется двумя причинами:
недостаточным вниманием к языковой проблематике (малые капитальные вложения,
отсутствие кадров лингвистов-прикладников) и отсутствием общей теории языка, без
которой все проводимые лингвистические работы носят частный характер и не дают
ощутимого практического результата.
Попытка создания такой теории была предпринята В.А. Карповым.
Ценность этой работы состоит, прежде всего, в том, что автор использует вариант
общей теории систем Ю.А. Урманцева, что позволяет избежать неполноты описания
языковой системы, формализовать основные знания о языке и эксплицировать их в
виде системокодов и алгоритмов.
Рассмотрим основные положения этой теории.
Под системой S В.А. Карпов вслед за Ю.А.Урманцевым понимает t-e множество
композиций Mi, построенное по отношениям Ri-м множества отношений {Ri),
операциям O. V-м множества операций (Oi,), законам композиций (-м множества
законов композиций (Zi) из первичных элементов R l-х множества M(0)i,
выделенного по основанию A(0)i из множества М.
Для доказательства системности русского языка должны быть решены следующие
задачи:
1. Определить исходное множество Mi, или лингвистический универсум.
2. Выбрать некоторое единое основание A(0)i для получения множества первичных
элементов.
3. Вывести или наложить на множество первичных элементов некоторое множество
отношений единства R(1)i
4. Вывести или наложить на множество первичных элементов некоторое множество
законов композиций Z(1)i.
5. Описать операции, по которым отроятся композиции первичных элементов.
6. Получить на базе всех описаний на выходе систему Si
Лингвистический универсум определен в виде литературы с ограничением
"прозаические тексты".
Для более четкого представления о возможностях выбора основания построена схема,
отражающая в наиболее общем виде различные структурные уровни речемыслительной
деятельности и связи между ними.
Определение языка, выведенное с помощью этой таблицы, имеет вид: "Язык - это
система, состоящая из трех типов систем разных уровней функционирования -
орфограмматик и орфосинтактик, словоформ и композиций и множеств словоформ и
множеств композиций".
В качестве основания для получения первичных элементов словоформ можно выбрать
пробел (пробел + знак препинания). Аналогично словоформа по некоторому основанию
членима на морфены, морфены на буквы и т.д.
Код отношений единства R.
Под отношением вообще понимается некоторое свойство (признак, качество,
количество; отдельного элемента или группы Элементов, однородных в некотором
отношении.
Первое отношение единства - единство класса. это значит, что первичные элементы
типа "тихо", "потихоньку", "быстро", "вскачь", "быстрее" принадлежат к одному
множеству первичных элементов (наречия), а элементы типа "мать", "сестра", "в
Калуге" - к другому подмножеству (существительные).
Второе отношение единства - это единство позиции, подпозиции. Оно означает, что
элементы внутри указанных подтипов находятся в одной позиции (или подпозиции),
например:
а) сестрой, Наташей, солнцем;
б) нашу, новую, родную;
в) выше, дальше, сильнее.
Существенным фактом является наличие у разных классов общих позиций, что
позволяет при необходимости отступать от традиционного деления, сводя, к
примеру, в один класс прилагательные, причастия, притяжательные местоимения на
основании одной группы изменений.
Третье отношение единства - единства корня, выражающее некоторую наиболее общую
для ряда элементов нерасчлененную идею (например элементы типа "брать",
"собрать", "избранник", "выборочно" связаны общей идеей). Всего для
трехпризнаковой R -системы, включая случай полного отсутствия всех трех
отношений единства, будет существовать восемь комбинаторных вариантов
(рис.7.27).
В нишу R1 попадают композиции типа: "поэт, поэт", "нет, нет", Петру Петровичу,
"два двадцать" и т.п., обладающие единством всех трех классов.
Рис. 7.27
В нише R2 находятся композиции типа "в лес"; "смелые, решительные", "поэт Блок",
"каждый встречный" и т.п., характеризующиеся единством класса и позиции.
В нише R3 (единство класса и корня) находятся композиции типа "честь честью",
"учу учить", "три на три" и т.п.
В нише R4 - композиции, характеризующиеся признаками единства позиции и корня:
"масло масляное", "Иван Ивановский", "писатель написал" и т.п.
В нише R5 - множества композиций, удовлетворяющих отношению единства класса:
"ученик чародея", "начал работать", "для очистки совести" и т.п. ".
В нише R6 (признак единства позиции) находятся следующие композиции: "веселые
ребята", "Наташа переехала", "заседание закрыто" и т.п.
Ниша R7 объединяет композиции, отвечающие отношению единства корня:
накрыл крышкой, ходить ходуном, объять необъятное и т.п.
В нише R8 - находятся следующие типы композиций (характеризующихся отсутствием
отношений единства): проткнул гвоздем, сидел в комнате, говорила громко и т.д.
Все многообразие фактического материала, имевшегося в распоряжении
исследователя, "упаковывается" в указанные восемь R-ниш.
Это свидетельствует в пользу того, что выведенные отношения единства русского
языка как предполагаемой системы оказываются достаточными для классификации
всего многообразия композиций по данным R.
Код законов композиций Z
Понятие позиция соответствует любой из форм изменений первичного элемента любого
класса, имеющего группу изменений. В том случае, если класс и элемент класса не
имеют изменений, можно говорить о нуль-позиции или исходной форме элемента.
Взаимодействие по крайней мере двух элементов - это разрешение на связь семантик
при определенных разрешениях на связь позиций, оно дает в результате композицию
первичных элементов. Нуль-композиция - это композиция из одного элемента.
Базовыми, ядерными называются двухэлементные композиции.
Наглядно законы композиций можно представить в виде матрицы, каждая клетка
которой и будет законом композиции (рис.7.28).
Автор приводит данные по вероятностной и реальной встречаемости элементов одного
класса и элементов разных классов в двухэлементных композициях.
На уровне классов можно говорить о 33-х законах композиции, а если не
пренебрегать порядком следования элементов в композициях, можно говорить о 66-х
законах композиции.
Существ.
Глагол
Прилаг.
Наречие
Предлог
Числит.
Местоим.
Существительн
Глагол
Прилагательн.
Наречие
Предлог
Числительное
Местоимение
Рис. 7.28
Системная лингвистическая модель русского языка (СЛМРЯ)
В отличие от многих других существующих модель, разработанная В.А.Карповым,
базируется на результатах системного подхода к изучению русского языка.
Лингвистическая часть модели описывается четырьмя блоками. К ним примыкают еще
два блока нелингвистического характера (рис. 7.29).
Рис.7.29
Однако приложения модели к задачам автоматизированной обработки текстов остаются
нечетко определенными.
Библиографический список
1. Бондарко Л.В.Звуковой отрой современного русского языка. М., 1976..
2. Вейжедл P.M. Представление знаний и обработка естественных .языков. М., 1986.
Т.74, * 7.
3. Катц Дж. Семантическая теория. Новое в зарубежной лингвистике. Вып.10. М.,
1981.
4. Лайонз Дж. Введение в теоретическую лингвистику. М., 1979.
5. Панов М.В. Современный русский язык. Фонетика. М., 1979.
6. Поспелов Г.С. Искусственный интеллект - основа новой информационной
технологии. М., 1988.
7. Фант Г. Акустическая теория речеобразования. М., 1964.
8. Филлмор И. Дело о падеже // Новое в зарубежной лингвистике. Вып.10. М., 1981.
9. Силлмор И. Дело о падеже открывается вновь // Новое в зарубежной лингвистике.
Вып.10 М.,. 1981.
10. .Шемакин Ю.И. Основы информатики и вычислительной лингвистики. М., 1983.
11. Шемакин Ю.И. Введение в информатику.М., 1985.
12. Якобсон P.O. Фант Г., Халле М. Введение в анализ речи ,// Новое в зарубежной
лингвистике. Вып.2., 1962.
13. Попов Э.В. Общение с ЭВМ на естественном языке. М., 1989.
14. Апресян Ю.Д. Лексическая семантика. М., 1974.
15. Падучева Е.В. Математические методы в теории научно-технической информации.
4.1. М., 1979.
ОГЛАВЛЕНИЕ
ВВЕДЕНИЕ 3
ГЛАВА 1. ОБЩЕЕ ПРЕДСТАВЛЕНИЕ О ЯЗЫКЕ 3
1.1. Язык и мышление 3
1.2. Язык как знаковая система 3
1.3. Язык и речь 3
1.4. Языковая структура. Уровни языка 3
2.1. Звуковой характер языка 3
2.4. Фонология. Понятие о фонеме 3
2.5. Звуки и буквы. Понятие об алфавите 3
Посмотри в окно!
Чтобы сохранить великий дар природы — зрение,
врачи рекомендуют читать непрерывно не более 45–50 минут,
а потом делать перерыв для ослабления мышц глаза.
В перерывах между чтением полезны
гимнастические упражнения: переключение зрения с ближней точки на более дальнюю.
3.1. Основные понятия. Морфема. Виды морфем 3
3.2. Формальные модели морфологии 3
3.3. Морфологические словари 3
4.1. Основные понятия. 3
4.2. Словосочетание 3
4.3. Предложение 3
4.4. Синтаксические отношения 3
4.5. Управление. Согласование. Примыкание 3
4.6. Коммуникативная организация предложения 3
4.7. Трансформационная (порождающая) грамматика 3
5.1. Основные понятия. Значение. Виды значений 3
5.2. Семантические отношения. Парадигматические и синтагматические отношения 3
5.3. Формальные модели семантики 3
5.4. Основы лексикографии 3
5.5. Семантические сети 3
5.6. Фрейм
Закладка в соц.сетях