Районирование
Районирование территорий или выделение объектов поиска в области поиска применяется при необходимости разделить территорию на группы похожих в некотором смысле друг на друга объекты. При этом можно понимать похожесть и как похожесть на некоторый эталонный объект и как похожесть внутри группы в признаковом пространстве и как похожесть на идеальный объект и т.п.
Для решения задачи районирования, то есть разбиения всей территории на группы похожих между собой объектов, необходимо определить, в каком смысле понимается эта похожесть. В ГИС INTEGRO она может пониматься в следующих смыслах:
- Объекты разбиты на группы похожих, если внутри каждой из групп мера сходства между любыми двумя объектами больше, чем мера сходства между любыми двумя объектами из разных групп.
- Объекты A и B считаются похожими, если найдется цепочка объектов, начинающаяся с A и кончающаяся B такая, что мера сходства между любыми двумя соседними объектами в этой цепочке достаточно велика.
- Объекты считаются похожими, если они одинаково похожи на объект, выбранный в качестве эталонного.
- Объекты считаются похожими, если они одинаково похожи на идеальный объект.
В соответствии с этим разработаны и методы решения задачи районирования:
- К-средних
- Голотипная таксономия
- Таксономия по мере сходства
- Таксономия по критериям
- Иерархическая таксономия
Для первых двух постановок задачи районирования для разбиения на группы желательно было бы также задать некоторый порог меры сходства, который бы использовался при разбиении. Однако вместо этого трудно интерпретируемого параметра можно задать другой - количество групп, на которое необходимо разбить множество объектов. Но задача районирования может решаться и при наличии единичных эталонов разных классов заданных в столбеце эталонов. Тогда количество групп задавать не надо, поскольку оно определяется автоматически из того соображения, что количество групп должно быть минимальным при условии, что эталоны разных классов не должны попасть в одну группу.
В случае отсутствия эталонов закономерно желание получить все множество разбиений, получаемых с разными порогами, а потом выбрать подходящее. Однако организовать это на большой выборке технически невозможно. Поэтому сначала производится объединение (склеивание) всех объектов в мелкие группы, а затем строится все множество разбиений, причем каждая мелкая группа рассматривается как единый объект. В зависимости от того первую или вторую концепцию похожести мы выбрали, эта программа реализуется иерархической кластеризацией по мере сходства и по графу соответственно.
При описании перечисленных выше методов для обозначения группы похожих объектов используются два термина: кластер и класс. Кластер, результат кластеризации - набор объектов, которые объединены в результате работы соответствующего алгоритма в одну группу в соответствие с особенностями конкретного алгоритма. Классом же называется группа объектов, которые были объединены пользователем на основе знания предметной области. Различные методы разбивают множество объектов на кластеры, далее в результате интерпретации специалистом выделяются уже осмысленные с точки зрения предметной области классы.