scipy.cluster.hierarchy.

ward#

scipy.cluster.hierarchy.ward(y)[источник]#

Выполнить связывание Уорда по сжатой матрице расстояний.

См. linkage для получения дополнительной информации о структуре возврата и алгоритме.

Ниже приведены распространённые соглашения о вызовах:

  1. Z = ward(y) Выполняет связывание Уорда по сжатой матрице расстояний y.

  2. Z = ward(X) Выполняет связывание Уорда по матрице наблюдений X используя евклидово расстояние как метрику расстояния.

Параметры:
yndarray

Сжатая матрица расстояний. Сжатая матрица расстояний — это плоский массив, содержащий верхнюю треугольную часть матрицы расстояний. Это форма, которую pdist возвращает. Альтернативно, набор из m векторов наблюдений в n измерениях может быть передан как массив размером m на n.

Возвращает:
Zndarray

Иерархическая кластеризация, закодированная как матрица связей. См. linkage для получения дополнительной информации о структуре возвращаемых данных и алгоритме.

Смотрите также

linkage

для расширенного создания иерархических кластеризаций.

scipy.spatial.distance.pdist

метрики попарных расстояний

Примечания

ward имеет экспериментальную поддержку совместимых с Python Array API Standard бэкендов в дополнение к NumPy. Пожалуйста, рассмотрите тестирование этих функций, установив переменную окружения SCIPY_ARRAY_API=1 и предоставление массивов CuPy, PyTorch, JAX или Dask в качестве аргументов массива. Поддерживаются следующие комбинации бэкенда и устройства (или других возможностей).

Библиотека

CPU

GPU

NumPy

н/д

CuPy

н/д

PyTorch

JAX

Dask

⚠️ объединяет блоки

н/д

См. Поддержка стандарта array API для получения дополнительной информации.

Примеры

>>> from scipy.cluster.hierarchy import ward, fcluster
>>> from scipy.spatial.distance import pdist

Сначала нам нужен игрушечный набор данных для экспериментов:

x x    x x
x        x

x        x
x x    x x
>>> X = [[0, 0], [0, 1], [1, 0],
...      [0, 4], [0, 3], [1, 4],
...      [4, 0], [3, 0], [4, 1],
...      [4, 4], [3, 4], [4, 3]]

Затем мы получаем сжатую матрицу расстояний из этого набора данных:

>>> y = pdist(X)

Наконец, мы можем выполнить кластеризацию:

>>> Z = ward(y)
>>> Z
array([[ 0.        ,  1.        ,  1.        ,  2.        ],
       [ 3.        ,  4.        ,  1.        ,  2.        ],
       [ 6.        ,  7.        ,  1.        ,  2.        ],
       [ 9.        , 10.        ,  1.        ,  2.        ],
       [ 2.        , 12.        ,  1.29099445,  3.        ],
       [ 5.        , 13.        ,  1.29099445,  3.        ],
       [ 8.        , 14.        ,  1.29099445,  3.        ],
       [11.        , 15.        ,  1.29099445,  3.        ],
       [16.        , 17.        ,  5.77350269,  6.        ],
       [18.        , 19.        ,  5.77350269,  6.        ],
       [20.        , 21.        ,  8.16496581, 12.        ]])

Матрица связей Z представляет дендрограмму — см. scipy.cluster.hierarchy.linkage для подробного объяснения его содержимого.

Мы можем использовать scipy.cluster.hierarchy.fcluster чтобы увидеть, к какому кластеру принадлежала бы каждая начальная точка при заданном пороге расстояния:

>>> fcluster(Z, 0.9, criterion='distance')
array([ 1,  2,  3,  4,  5,  6,  7,  8,  9, 10, 11, 12], dtype=int32)
>>> fcluster(Z, 1.1, criterion='distance')
array([1, 1, 2, 3, 3, 4, 5, 5, 6, 7, 7, 8], dtype=int32)
>>> fcluster(Z, 3, criterion='distance')
array([1, 1, 1, 2, 2, 2, 3, 3, 3, 4, 4, 4], dtype=int32)
>>> fcluster(Z, 9, criterion='distance')
array([1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1], dtype=int32)

Также, scipy.cluster.hierarchy.dendrogram может использоваться для генерации графика дендрограммы.