Представление данных в одном, двух и трех измерениях



К этой группе методов относятся хорошо известные способы отображения информации, которые доступны для восприятия человеческим воображением. Практически любой современный инструмент, напримерDataMining, включает способы визуального представления из этой группы.

В соответствии с количеством измерений представления это могут быть следующие способы:

· одномерное (univariate) измерение, или 1-D ;

· двумерное (bivariate) измерение, или 2-D ;

· трехмерное или проекционное (projection) измерение, или 3-D.

Следует заметить, что наиболее естественно человеческий глаз воспринимает двухмерные представления информации.

При использовании двух- и трехмерного представления информации пользователь имеет возможность увидеть закономерности набора данных:

· его кластерную структуру и распределение объектов на классы (например, на диаграмме рассеивания);

· топологические особенности;

· наличие трендов;

· информацию о взаимном расположении данных;

· существование других зависимостей, присущих исследуемому набору данных.

Если набор данных имеет более трех измерений, то возможны такие варианты:

·использование многомерных методов представления информации (они рассмотрены ниже);

·снижение размерности доодно-, двух- или трехмерного представления.

 

Существуют различные способы снижения размерности. Для снижения размерности и одновременного визуального представления информации на двумерной карте используются самоорганизующиеся карты Кохонена.

Представление данных в 4 + измерениях

Представления информации в четырехмерном и более измерениях недоступны для человеческого восприятия. Однако разработаны специальные методы для возможности отображения и восприятия человеком такой информации.

Наиболее известные способы многомерного представления информации:

· параллельные координаты ;

· " лица Чернова ";

· лепестковые диаграммы.

 

Параллельные координаты

В параллельных координатах переменные кодируются по горизонтали, вертикальная линия определяет значение переменной. Пример набора данных, представленного в декартовых координатах и параллельных координатах, дан на рис. 16.1 [22]. Этот метод представления многомерных данных был изобретен Альфредом Инселбергом (AlfredInselberg ) в 1985 году.

"Лица Чернова"

Основная идея представления информации в " лицах Чернова " состоит в кодировании значений различных переменных в характеристиках или чертах человеческого лица [66]. Пример такого "лица" приведен на рис.16.2.

Рис. 16.2. "Лицо Чернова"

Для каждого наблюдения рисуется отдельное "лицо". На каждом "лице" относительные значения переменных представлены как формы и размеры отдельных черт лица (например, длина и ширина носа, размер глаз, размер зрачка, угол между бровями).

Анализ информации при помощи такого способа отображения основан на способности человека интуитивно находить сходства и различия в чертах лица.

На рис. 16.3 представлен набор данных, каждая запись которого выражена в виде " лица Чернова ".


Рис. 16.3. Пример многомерного изображения данных при помощи "лиц Чернова"

Перед использованием методов визуализации необходимо:

· Проанализировать, следует ли изображать все данные или же какую-то их часть.

· Выбрать размеры, пропорции и масштаб изображения.

· Выбрать метод, который может наиболее ярко отобразить закономерности, присущие набору данных.

Многие современные средства анализа данных позволяют строить сотни типов различных графиков и диаграмм. Поэтому выбор метода визуализации, если он самостоятельно осуществляется пользователем, не так прост и легок, как может показаться на первый взгляд. Наличие большого количества средств визуализации, представленных в инструменте, который применяет пользователь, может даже вызвать растерянность.

Одну и ту же информацию можно представить при помощи различных средств. Для того чтобы средство визуализации могло выполнять свое основное назначение - представлять информацию в простом и доступном для человеческого восприятия виде - необходимо придерживаться законов соответствия выбранного решения содержанию отображаемой информации и ее функциональному назначению. Иными словами, нужно сделать так, чтобы при взгляде на визуальное представление информации можно было сразу выявить закономерности в исходных данных и принимать на их основе решения.

Среди двухмерных и трехмерных средств наиболее широко известны линейные графики, линейные, столбиковые, круговые секторные и векторные диаграммы.

Приведем рекомендации по использованию этих наиболее простых и популярных средств визуализации.

При помощи линейного графика можно отобразить тенденцию, передать изменения какого-либо признака во времени. Для сравнения нескольких рядов чисел такие графики наносятся на одни и те же оси координат.

Гистограмму применяют для сравнения значений в течение некоторого периода или же соотношения величин.

Круговые диаграммы используют, если необходимо отобразить соотношение частей и целого, т.е. для анализа состава или структуры явлений. Составные части целого изображаются секторами окружности. Секторы рекомендуют размещать по их величине: вверху - самый крупный, остальные - по движению часовой стрелки в порядке уменьшения их величины. Круговые диаграммы также применяют для отображения результатов факторного анализа, если действия всех факторов являются однонаправленными. При этом каждый фактор отображается в виде одного из секторов круга.

Выбор того или иного средства визуализации зависит от поставленной задачи (например, нужно определить структуру данных или же динамику процесса) и от характера набора данных.

Качество визуализации

Современные аналитические средства, в том числе и DataMining, немыслимы без качественной визуализации. В результате использования средств визуализации должны быть получены наглядные и выразительные, ясные и простые изображения, за счет использования разнообразных средств: цвета, контраста, границ, пропорций, масштаба и т.д.

В связи с ростом требований к средствам визуализации, а также необходимости сравнивания их между собой, в последние годы был сформирован ряд принципов качественного визуального представления информации.

Принципы Тафта (Tufte'sPrinciples) графического представления данных высокого качества [67] гласят:

· предоставляйте пользователю самое большое количество идей,

· в самое короткое время,

· с наименьшим количеством чернил на наименьшем пространстве;

· говорите правду о данных.

Основные принципы компоновки визуальных средств представления информации:

· Принцип лаконичности.

· Принцип обобщения и унификации.

· Принцип акцента на основных смысловых элементах.

· Принцип автономности.

· Принцип структурности.

· Принцип стадийности.

· Принцип использования привычных ассоциаций и стереотипов.

Принцип лаконичности говорит о том, что средство визуализации должно содержать лишь те элементы, которые необходимы для сообщения пользователю существенной информации, точного понимания ее значения или принятия (с вероятностью не ниже допустимой величины) соответствующего оптимального решения.

Кроме обозначенных выше принципов, средство визуализации должно обладать высокой надежностью и скоростью, которая устроит пользователя, принимающего на основе этой информации решения.


Дата добавления: 2018-06-01; просмотров: 887; Мы поможем в написании вашей работы!

Поделиться с друзьями:






Мы поможем в написании ваших работ!