Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Скачиваний:
0
Добавлен:
20.04.2023
Размер:
3.56 Mб
Скачать

- все логические отношения, используемые в естественно-языковых высказываниях,

должны быть приведены к установленной (канонической форме), исключены реверсивные формы временных и причинно-следственных отношений (например, фраза «событие X

произошло по причине того, что произошло событие Y» должна быть преобразована к виду

«по причине того, что произошло событие Y, произошло событие X», что позволяет перейти

кутверждению «событие Y есть причина события X»);

-терминология в рамках сообщения должна быть приведена к эталонному лексикону,

построенному на основе лексикона сообщения с привлечением системного тезауруса и с сохранением исходного уровня конкретизации атрибутов сущностей, упоминаемых в сообщении.

Столь строгие ограничения, налагаемые на способ представления текста,

предоставляют ряд преимуществ при анализе текста, приобретаемые за счет высокой степени его формализации.

Так, например, одним из важнейших преимуществ является возможность автоматизированного анализа логических отношений между компонентами высказываний.

Канонизированный текст может быть подвергнут процедуре анализа внутренней непротиворечивости с применением логики естественных рассуждений , которая может рассматриваться либо в базисе положений алгебры множеств и теории графов, либо в базисе теории частично упорядоченных множеств с квазидополнениями. При этом элементарные высказывания выступают в качестве аксиом полисиллогизма (системы логических утверждений, в которой количество исходных посылок превышает два), образованного их совокупностью, данной в тексте. Поскольку текст не всегда содержит полное множество высказываний, достаточных для производства вывода, при интерпретации текста могут привлекаться знания, имеющиеся в системе на момент его анализа.

Более того, канонизированный текст может быть охарактеризован уникальным лексическим спектром, отображающим его тематику, что позволяет использовать при анализе массивов текстов методы, сходные с методами распознавания сигналов. Спецификой лексического спектра является то, что в качестве аналога частотной оси для него выступает шкала тезауруса источника сообщений, а в качестве метафоры энергии — отношение числа употреблений термина к общему числу терминов в тексте.

Статистические характеристики канонизированного текста (такие, как частотно-

ранговое распределение длин терминов, традиционно используемое при статистическом анализе текстов) приобретают вид, отличный от вида аналогичных характеристик обычного текста. За счет того, что в канонизированном тексте отсутствуют термины, используемые в обычном (стилистически корректном) тексте для построения анафорических конструкций

(отсылок к предыдущим фрагментам текста), в подвергаемую статистическому анализу выборку попадают и те употребления терминов, которые ранее не могли быть учтены из-за того, что подстановочные конструкции (например, анафорические местоимения)

традиционно включаются в перечень слов, исключавшихся из текста при проведении статистического анализа. В результате чего могут быть выявлены термины, действительно образующие структуру релевантности текста. В канонизированном представлении текста продолжают выполняться закономерности, выраженные в принципе лингвистической экономии Г.К. Зипфа, что делает полученный текст пригодным для выполнения процедуры автореферирования на основе анализа статистических характеристик. Однако статистические критерии здесь приобретают более объективный характер, благодаря восстановлению системы умолчаний, используемых источником сообщения с целью сокращения синтаксической избыточности.

Использование спектрального представления сообщений позволяет упростить процедуры построения (связывания) и отображения системы логических связей сообщений и событий, упоминаемых в сообщении и его контексте, а также построить развернутые во времени и пространстве системы связей с привлечением сообщений, образующих внешний контекст (исходящих от других источников).

Важной особенностью такого подхода является то, что с его применением могут быть построены модели двух типов:

-модели динамики потока сообщений;

-модели динамики событий.

В этом случае преобразованный массив сообщений может быть представлен в виде логико-лингвистической модели, в графической интерпретации приобретающей вид ветвящегося графа, где ветвления указывают на наличие логических противоречий,

разрешение которых возможно с применением мажоритарных и иных методов.

Серьезной проблемой при проведении автоматизированного анализа с применением формально-логических методов является проблема неоднородности представления высказываний. Одни и те же сущности и отношения могут быть выражены в различных терминах, зачастую принадлежащих к разным уровням терминологической иерархии.

Например, слова «автомобиль» и «грузовик», не являясь синонимами и имея различный объем понятия, в тексте могут означать одно и то же. Решению этой проблемы может способствовать применение иерархических тезаурусов. То есть, синтезируемые в ходе ИАР модели должны обладать возможностью применения к ним многоуровневого иерархического тезауруса, реализованного в виде совокупности семантических сетей, построенных в терминах различного уровня абстракции. За счет этого модели позволяют осуществлять над

ними операцию смены уровня абстракции (общности) описаний и приобретают свойства масштабируемости во времени.

Ситуационные модели, полученные с применением таких представлений позволяют использовать для анализа непротиворечивости сообщений совокупность стандартизированных процедур формального логического анализа. Более того, методы решения полисиллогизмов, предложенные Б.А. Куликом, позволяют выявить факт неполноты системы аксиом и сформировать множество высказываний, которыми может быть дополнена аксиоматическая система, а также сформулировать полное множество логических выводов из системы посылок. Благодаря этому могут быть сформулированы задания на компенсацию неполноты массива исходных данных, а также определить комплекс противоречивых высказываний, сопоставить их с источниками и сформулировать гипотезу о степени достоверности сведений, поставляемых ими.

Несмотря на то, что это не позволяет сделать вывод о достоверности сведений,

поставляемых конкретным источником (за исключением случая наличия внутренней противоречивости в его сообщениях), подобные методы позволяют оценить степень непротиворечивости сведений, полученных от группы источников. В результате чего, при наличии источников более достоверной информации может быть сформулирован комплекс мероприятий, направленных на устранение противоречивости.

3.8.2 Нетекстовые модели как инструмент верификации данных

Сколь бы совершенны ни были средства логического анализа достоверности данных,

однако при условии, что стратегии дезинформации разработаны высококвалифицированными специалистами, располагающими столь же совершенными

«электронными помощниками», реальной возможности верификации данных они не предоставляют.

При проведении анализа достоверности данных о состоянии или тенденциях изменения состояния систем в отраслях, не сопряженных с целенаправленным управлением параметрами процесса, либо имеющих систему жестких ограничений, обусловленных спецификой протекания базисных процессов, используются знания о наиболее общих закономерностях, определяющих поведение таких систем. Здесь широко применяются методы: теории вероятностей, математической статистики, формальной логики, теории измерений, а также законы, открытые в частных разделах естественнонаучных дисциплин.

Для таких систем, как правило, существует возможность синтеза модели,

учитывающей диапазоны возможных значений и предельные динамические характеристики,

на основе применения которой можно судить о достоверности/ошибочности данных,

наличии искажений, вызванных теми или иными возмущающими воздействиями.

Ранее, рассматривая вопросы, связанные с моделированием систем, мы указывали,

что модель является инструментом проверки гипотез. То есть, модель — это всегда инструмент верификации некоторой совокупности высказываний. Так что, вывод о возможности использования моделей для анализа достоверности сообщений является вполне естественным.

Очень часто, используя модели в реальной жизни, мы даже не задумываемся о том,

что это действительно происходит. Многим людям, которым доводилось разрабатывать бизнес-планы, и в голову не приходило, что они занимались моделированием. Бухгалтер,

составляющий балансовую отчетность, тоже редко задумывается о том, что он решает задачу оптимизации на достаточно сложной модели. Иными словами, модели — не есть нечто чуждое практике, вопрос лишь в том, сознаем ли мы факт их применения.

Допустим, что некая организация предлагает на сверхвыгодных условиях вложить деньги в «верное» дело. Зачастую наши сограждане, выяснив, сколько просят и что обещают,

вкладывают и... теряют. Соображения их таковы: если просят немного, а обещают изрядно,

то можно и дать — авось получится? Такой подход представляет собой подмену моделирования примитивным сравнением альтернатив, не учитывающим рисков, связанных с ошибочным выбором. Другое дело — взвешенный подход, связанный с оцениванием производственных затрат, спроса на продукцию, емкости рынка и иных характеристик социально-экономической системы. Объектом риска здесь, являются уже отнюдь не личные сбережения, а корпоративные финансы и ресурсы, соответственно требуется серьезное исследование, стоящее не малых средств. В последние годы в России появилось множество организаций, занятых проведением опросов общественного мнения, в нашу страну пришли и зарубежные фонды и институты, проводящие маркетинговые, социологические и иные исследования, например, Институт Гэллапа. Данные, получаемые в ходе подобных исследований, представляют высочайшую ценность, поскольку позволяют прибегнуть к аппарату математики, теории вероятности и математической статистики, то есть,

воспользоваться инструментами повышения объективности выводов, вырваться из цикла эмоциональной вовлеченности и здраво оценить ситуацию.

Модели аналитические и имитационные, полунатурные и натурные, модели реального времени и допускающие временное масштабироване — значение их в том, что они являются инструментом «выращивания» нового знания, причем знания более «дешевого», нежели знание, полученное ценой полномасштабного эксперимента.

Проблема состоит в том, что затраты на синтез адекватной модели иногда оказываются сопоставимы с ценой ошибки. Поэтому, руководители часто отказываются от моделирования, забывая о том, что в случае ошибки средства просто теряются, в то время,

как затраты на моделирование аккумулируются в модели. Модель-то остается и может быть использована вновь!

Проводя исследования в различных системах, сталкиваясь с разными по своей природе процессами, аналитик выбирает наиболее пригодный для решения задач анализа инструментарий исследования. Например, для моделирования результативности рекламной кампании, зачастую используется математический аппарат теории клеточных автоматов,

аналогичный математический аппарат используется и в многоуровневом маркетинге (с

линейной и нелинейной системой перераспределения прибыли). В других случаях оказывается эффективен математический аппарат теории линейного программирования.

Однако единственное, ради чего используются все эти изощренные математические средства

— это проверка истинности или ложности некоторого комплекса суждений.

Неслучайно в конце этой книги мы поместили приложение «Вариант организации процесса перспективного планирования на примере плана USAF2025» — там наглядно показана процедура построения дерева целей и задач для дальнейшего перехода от качественных оценок к оценкам количественным. Как только мы получаем модель,

использующую некоторую метрику, пригодную для сравнения альтернатив, мы получаем инструмент, обеспечивающий возможность аргументированной оценки утверждений на основе вычисления логических переменных.

3.9Средства автоматизации ИАР

Всамом начале первого раздела этой главы нами была приведена классификация средств автоматизации информационной работы. В соответствии с этой классификацией средства автоматизации делились на средства сбора, доставки, хранения и обработки данных, средства формирования и согласования тезауруса, средства интеграции и анализа данных, средства моделирования, средства интерпретации результатов, средства прогнозирования, средства синтеза целей управления, средства отображения данных,

средства поддержки принятия решений и доведения управляющих воздействий.

Совершенствованию этих средств уделяется большое внимание: сегодня конкуренция в области создания средств поддержки ИАР превратилась из привычного соревнования фирм-разработчиков в гонку информационных технологий на государственном уровне.

Безусловно, гонка вооружений также подстегивает развитие информационных технологий,

однако практика показывает, что по поражающей мощи вооружений и точности средств

доставки боевых зарядов государства, стремящиеся к мировому лидерству, пребывают примерно на одинаковом уровне. Сейчас дорога к лидерству не может быть расчищена исключительно боевым потенциалом вооруженных сил государства — этого недостаточно,

да и слишком велика цена такого лидерства. Собственно, войны никогда не выигрывались исключительно оружием — это всегда было суровое испытание, в котором экономика,

идеология, система управления государства доказывали свою жизнеспособность. Оружие массового поражения ненадолго поколебало уверенность в том, что это так, но когда оно перешло в категорию средств сдерживания нападения, все вернулось на круги своя. Теперь информационные технологии как инструмент повышения эффективности и оперативности процессов управления стали одним из основных элементов системы обеспечения экономической (и военной) безопасности государства, его граждан и субъектов экономической деятельности.

Говоря о средствах автоматизации и информатизации ИАР, следует выделять следующие классы:

-средства обеспечения ИАР, непосредственно не предназначенные для обработки и анализа информации (телекоммуникационное обеспечение ИАР, средства сбора, накопления

ихранения данных, средства отображения информации);

-средства ведения ИАР, непосредственно предназначенные для обработки и анализа информации (различного рода пакеты статистической обработки данных,

автоматизированные системы поддержки процессов моделирования сложных систем и анализа данных, лингвистические инструменты и т. д.).

Здесь нас интересуют не столько тонкости технической реализации, сколько идеи,

заложенные в основу их функционирования, а также те положительные и отрицательные черты, которые эти средства способны привнести в ИАР.

Наиболее обширным и разнообразным по составу является класс средств обеспечения ИАР. Средства ведения ИАР отстают в своем развитии — оно и понятно: сложность аналитических процессов крайне высока...

3.9.1 Средства сбора информации

Едва ли стоит перечислять все то многообразие средств сбора информации, которое имеется в распоряжении профессионального аналитика, тем более, что в зависимости от класса систем, в отношении которых ведется ИАР, и бюджета субъекта ИАР комплектация существенно варьируется.

Многое из арсенала средств сбора информации лишь дублирует возможности органов чувств человека, обеспечивая лишь «эффект присутствия» — это разнообразные системы

теленаблюдения и иные инструментальные средства, позволяющие осуществлять дистанционный сбор информации, которая могла бы быть воспринята и без инструментария сбора данных, будь аналитик непосредственным участником неких событий. Другая группа средств сбора данных существенно расширяет и дополняет «ощущения», за счет придания свойств наблюдаемости тем феноменам, которые принципиально не могут наблюдаться посредством органов чувств человека: это расширение частотных/временных и энергетических диапазонов чувствительности человека (инфрадо ультразвукового диапазона механических колебаний, от радиочастотного диапазона до ультрафиолетового диапазона электромагнитных колебаний, от микрообъектов до макрообъектов и т. д.).

Арсенал этих средств чрезвычайно богат.

Остановимся на средствах сбора наиболее очевидных и наименее достоверных данных — данных языковых коммуникаций и знаковых данных. В последние годы в этой отрасли развитие средств сбора происходит доселе невиданными темпами. Созданы средства распознавания и преобразования к символьному виду речевых сигналов, средства распознавания графических начертаний символов (оптические распознающие системы — сканеры), средства считывания картографических данных и т. п. графической информации.

Создание этих средств дало мощный толчок развитию систем компьютерной обработки знаковых данных: сегодня, благодаря их использованию, аналитики получили доступ к неисчерпаемым ресурсам научно-технической, политической, экономической и иной информации. Пока лишь малая толика того, что хранится в глобальной телекоммуникационной сети (ГСТК) Интернет, набрана вручную — преимущественно эти ресурсы получены методом сканирования самых разнообразных печатных источников, хотя,

наиболее вероятно, что постепенно ситуация будет меняться в пользу ресурсов, полученных методом голосового ввода.

В последние годы силами энтузиастов в ГСТК размещены электронные копии уникальных изданий. Мощные массивы англоязычных электронных документов сосредоточены в рамках некоммерческого проекта электронной библиотеки Project Gutenberg (http://www.gutenberg.net/). Российские ресурсы электронных копий научных,

учебных и художественных изданий и также весьма обширны: здесь и Библиотека Мошкова

(http://lib.ru/), и Big Information System Project (http://nmsf.sscc.ru/), и Открытая Русская Электронная Библиотека (http://orel.rsl.ru/), и Домашняя электронная библиотека

(http://kniga.bibirevo.net/), и многие другие ресурсы. Однако в силу стремления к личной известности начинателей бесплатных электронных библиотек (следует отдать им должное — это достойные люди), в российском сегменте Интернет, получившем название «Рунет»,

отсутствует единый каталог, а система каталогизации далека от совершенства. За рубежом

интенсивно развиваются проекты, направленные на стандартизацию поисковых интерфейсов и формата представления электронных документов. Так, например, в библиотечном деле широко внедряется стандарт представления текстовых данных для организации поисковых интерфейсов Z39.50 и его международная версия ISO 23950, развивается проект TEI — Text

Encoding Initiative, выпустивший уже четвертую спецификацию стандарта — в России же этот процесс существенно запаздывает. Такое отставание снижает ценность информационных ресурсов, поскольку отсутствие четких правил формализации приводит к снижению эффективности поисковых процедур.

Интересный класс электронных информационных ресурсов оперативного плана — это электронные СМИ, размещающие и распространяющие свою информационную продукцию с применением инфраструктуры глобальных и национальных телекоммуникационных сетей. В

ГСТК Интернет функционируют СМИ и информационные агентства, предоставляющие оперативную информацию, используя on-line (интерфейсы функционирующие в режиме непосредственного доступа) и off-line (интерфейсы функционирующие в режиме неоперативного доступа, например, рассылка новостей за некоторый интервал времени посредством электронной почты). В настоящее время в ГСТК представлены ведущие мировые информационные агентства (Associated Press, CNN, France Press, Интерфакс, АПН

«Новости», ИТАР-ТАСС и многие другие) и газеты (New York Times, Washington Post,

Газета.RU и иные). Чрезвычайно информативны ленты новостей, предоставляемые информационными агентствами в режиме on-line с периодичностью обновления порядка единиц минут, биржевые рейтинги, публикуемые крупнейшими финансовыми и фондовыми биржами и крупными брокерскими объединениями.

Инструментарий сбора информации из подобных источников информации представляет собой преимущественно программно-аппаратные комплексы, обеспечивающие подключение к ресурсам телекоммуникационных сетей в соответствии с действующими протоколами обмена данными (как правило, это протоколы TCP/IP, PPP, SLIP, ISDN) и

востребование данных с применением как профессионального, так и непрофессионального специализированного и общего программного обеспечения. Этот класс программного обеспечения весьма многообразен и включает в себя: интеллектуальные поисковые программы, неинтеллектуальные интерфейсы просмотра данных, программы,

осуществляющие периодическое сканирование наиболее информативных источников,

программы потокового ввода и иные. Финансовые механизмы обеспечения оплаты информационных услуг могут существенно разниться от условно-бесплатного предоставления информации (подача в сопровождении рекламы) до заключения договоров на информационное обслуживание.

Говоря об ГСТК Интернет, следует упомянуть о важнейшей особенности этого источника информации. Эта особенность — принцип предоставления информации по требованию — не позволяет рассматривать ГСТК Интернет, как явление того же прядка, что и иные источники информации. Принцип предоставления информации по требованию настолько специфичен, что способен в корне преобразовать человеческую личность. Обычно информация поступает к человеку по многим каналам информационного взаимодействия в режиме, который можно было бы назвать принудительным — информация (самая разная!)

всегда «врывалась» в потребителя вне зависимости от его потребностей. Это спасительное для человека свойство информационного взаимодействия человека со средой обитания с появлением феномена СМИ (тем более, электронных СМИ) перестало быть непременным атрибутом интерьера информационного взаимодействия — человек (в который уже раз)

создал альтернативную реальность. С каждым технологическим достижением она становится все более плотной (по ощущениям) и способна предоставить «материальные свидетельства» своего существования. По существу, ГСТК легко может претендовать на «место жительства Бога» и стать предметом спекуляций различного рода лжепророков. «Ищущий, да обрящет...» — человек, использующий схему взаимодействия запрос-ответ, легко может быть помещен в специфический информационный интерьер (а еще чаще добровольно и собственноручно помещает себя в него).

В США, например, рядом специалистов в области прикладной информатики (это не какие-нибудь мрачные персонажи типа Доктора Зло, а благонамеренные ученые93) на уровне интересной гипотезы рассматривается возможность создания виртуальной реальности для целых народов, в которой они будут ощущать себя максимально комфортно

(чем не решение проблемы стран-изгоев?). Представьте себе: вы живете в единственном в мире социалистическом государстве, пребывая в полной уверенности, что на планете давно уже победил социализм, а в отдельных странах уж и коммунизм почти отстроили. Также тихо и мирно в соседних домах спят, посапывая, христиане и нехристи, сатанисты и католики — идиллия, да и только. Нет, действительно, потрясающий сюжет...

«Так то в Греции, — там тепло...» — скажете вы словами Василия Алибабаевича из

«Джентльменов удачи» — «У нас такого и быть-то не может». Но ряд интересных закономерностей развития сетевых СМИ можно проследить и на примере российского сегмента ГСТК Интернет. В настоящее время целый ряд сетевых СМИ (и не каких-нибудь, а

наиболее цитируемых в различных средствах массовой информации) создан и функционирует при поддержке и непосредственном участии Фонда Эффективной Политики

(ФЭП), созданного известным российским политтехнологом Г. Павловским. Оно бы и ничего, «был бы человек хороший», да, вот ведь, в чем беда — качество человека здесь

несущественно! Обращаясь к средствам массовой информации, носящим разные наименования, мы ожидаем разнообразия мнений, случайной структуры потока информации,

полагаем, что многообразие наименований отражает многообразие точек зрения... и

обманываемся.

Именно поэтому использование исключительно пассивных методов сбора информации в современных условиях нельзя считать приемлемыми. При работе с вторичными источниками информации, к которым могут быть отнесены все без исключения средства массовой информации, допустимо использование только активных методов сбора информации либо при анализе данных должны быть учтены все специфические акценты,

которые обусловлены ценностной ориентацией источника информации.

Так, в настоящее время в интересах использования ресурсов ГСТК Интернет для решения задач информационного обеспечения деятельности военно-политического руководства американским агентством перспективных исследований МО США рассматриваются проекты систем, реализующих активный мониторинг ресурсов сети с применением аппарата семантических сетей. Предполагается, что за счет этого система сбора информации по качеству совокупности добываемых данных сможет приблизиться к системам непосредственного перехвата информации из каналов внутрисистемных коммуникаций.

Интересный класс средств сбора информации из телекоммуникационных сетей представляют собой, так называемые, «троянские кони», «сетевые черви» и иные программы, предназначенные для осуществления несанкционированного доступа к защищаемым личным и корпоративным ресурсам, хранящимся на компьютерах,

подключенных к сети. Эти программы, несмотря на множество различий в стратегии проникновения к данным, имеют много общего и могут использоваться для сбора информации, пересылая критическую информацию внешнему потребителю. Низкий профессионализм среднестатистического пользователя персонального компьютера, как правило, не позволяет обнаружить факт утечки данных, а в случае корпоративного пользователя, где служба защиты данных поставлена должным образом, чаще используются иные методы несанкционированного доступа к данным (сетевые анализаторы, системы перехвата внешнего трафика сообщений и иные).

В этом подразделе мы выделили и рассмотрели особенности достаточно узкого класса средств сбора информации, исходя из тех соображений, что прочие средства сбора информации взаимодействуют преимущественно с физическими процессами, данные о характеристиках которых можно считать высоконадежными (почти не подверженными модификации, хотя существуют и эффективные средства маскировки, взять, хотя бы те же

Соседние файлы в папке из электронной библиотеки