💡 Инструкция: Выберите один ответ из пяти. На 30 вопросов отведено 85 минут. Читайте код построчно, учитывайте типы, атрибуты, пропуски и допущения анализа. После завершения откроются общий процент, 6 тематических шкал и объяснение к каждому заданию.
Вопрос 1 из 30
Ситуация: Возраст и доход входят в кластеризацию без преобразований, и группы почти полностью определяются доходом. Что является главным техническим основанием для разбора?
R Фрагмент R Копировать
x <- data.frame(age=c(20,21,60), income=c(30000,31000,32000))
result <- as.matrix(dist(x))
result
Метрика расстояния определяет, что считается похожим; масштаб признаков и их тип напрямую меняют геометрию кластеров
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве
Иерархическая кластеризация строит дерево объединений, а метод linkage определяет расстояние между кластерами
Вопрос 2 из 30
Ситуация: Возраст и доход входят в кластеризацию без преобразований, и группы почти полностью определяются доходом. Что именно может сломаться при новых данных?
R Фрагмент R Копировать
x <- data.frame(age=c(20,21,60), income=c(30000,31000,32000))
result <- as.matrix(dist(x))
result
Кластер может отражать источник данных, пакет измерений или пропуски, а не содержательную группу объектов
single linkage может создавать цепочки, соединяя группы через последовательность промежуточных точек
Сохранение только меток кластеров не позволяет повторить центры и применить решение к новым данным
Признак в тысячах доминирует над признаком в долях при евклидовом расстоянии без стандартизации
Алгоритм чувствителен к инициализации, выбросам и масштабу, поэтому один запуск может дать случайно слабое решение
Вопрос 5 из 30
Ситуация: Возраст и доход входят в кластеризацию без преобразований, и группы почти полностью определяются доходом. Какое заключение останется верным и на новых данных?
R Фрагмент R Копировать
x <- data.frame(age=c(20,21,60), income=c(30000,31000,32000))
result <- as.matrix(dist(x))
result
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов; при этом главный риск состоит в том, что признак в тысячах доминирует над признаком в долях при евклидовом расстоянии без стандартизации
Метрика расстояния определяет, что считается похожим; масштаб признаков и их тип напрямую меняют геометрию кластеров; следовательно, предупреждения можно не учитывать, если итог выглядит ожидаемо
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов; при этом главный риск состоит в том, что кластер может отражать источник данных, пакет измерений или пропуски, а не содержательную группу объектов
Метрика расстояния определяет, что считается похожим; масштаб признаков и их тип напрямую меняют геометрию кластеров; при этом главный риск состоит в том, что сохранение только меток кластеров не позволяет повторить центры и применить решение к новым данным
Метрика расстояния определяет, что считается похожим; масштаб признаков и их тип напрямую меняют геометрию кластеров; при этом главный риск состоит в том, что признак в тысячах доминирует над признаком в долях при евклидовом расстоянии без стандартизации
Вопрос 6 из 30
Ситуация: Команда запускает k-means один раз без seed и получает разные сегменты в двух одинаковых отчётах. Какой принцип непосредственно относится к этому коду?
R Фрагмент R Копировать
x <- scale(iris[, 1:4])
result <- kmeans(x, centers = 3, nstart = 1)
result
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве
Иерархическая кластеризация строит дерево объединений, а метод linkage определяет расстояние между кластерами
Метрика расстояния определяет, что считается похожим; масштаб признаков и их тип напрямую меняют геометрию кластеров
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов
Вопрос 10 из 30
Ситуация: Команда запускает k-means один раз без seed и получает разные сегменты в двух одинаковых отчётах. Какой итог разбора не смешивает правило языка с впечатлением от результата?
R Фрагмент R Копировать
x <- scale(iris[, 1:4])
result <- kmeans(x, centers = 3, nstart = 1)
result
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве; при этом главный риск состоит в том, что алгоритм чувствителен к инициализации, выбросам и масштабу, поэтому один запуск может дать случайно слабое решение
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве; при этом главный риск состоит в том, что сохранение только меток кластеров не позволяет повторить центры и применить решение к новым данным
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов; при этом главный риск состоит в том, что кластер может отражать источник данных, пакет измерений или пропуски, а не содержательную группу объектов
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве; поэтому внешний вид напечатанного объекта важнее происхождения и структуры данных
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов; при этом главный риск состоит в том, что алгоритм чувствителен к инициализации, выбросам и масштабу, поэтому один запуск может дать случайно слабое решение
Вопрос 11 из 30
Ситуация: Данные содержат мост из промежуточных объектов, и single linkage объединяет два визуально разных облака. Какое правило нужно применить к этому фрагменту прежде всего?
R Фрагмент R Копировать
x <- scale(USArrests)
hc <- hclust(dist(x), method = 'single')
result <- cutree(hc, k = 4)
result
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов
Метрика расстояния определяет, что считается похожим; масштаб признаков и их тип напрямую меняют геометрию кластеров
Иерархическая кластеризация строит дерево объединений, а метод linkage определяет расстояние между кластерами
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве
Вопрос 15 из 30
Ситуация: Данные содержат мост из промежуточных объектов, и single linkage объединяет два визуально разных облака. Как сформулировать вывод без лишних обобщений?
R Фрагмент R Копировать
x <- scale(USArrests)
hc <- hclust(dist(x), method = 'single')
result <- cutree(hc, k = 4)
result
Иерархическая кластеризация строит дерево объединений, а метод linkage определяет расстояние между кластерами; при этом главный риск состоит в том, что алгоритм чувствителен к инициализации, выбросам и масштабу, поэтому один запуск может дать случайно слабое решение
Иерархическая кластеризация строит дерево объединений, а метод linkage определяет расстояние между кластерами; при этом главный риск состоит в том, что single linkage может создавать цепочки, соединяя группы через последовательность промежуточных точек
Иерархическая кластеризация строит дерево объединений, а метод linkage определяет расстояние между кластерами; поэтому отсутствие сообщения об ошибке уже подтверждает корректность результата
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов; при этом главный риск состоит в том, что кластер может отражать источник данных, пакет измерений или пропуски, а не содержательную группу объектов
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве; при этом главный риск состоит в том, что single linkage может создавать цепочки, соединяя группы через последовательность промежуточных точек
Вопрос 16 из 30
Ситуация: В отчёте выбрано пять сегментов только потому, что эта версия удобнее для маркетинговых названий. Какой механизм точнее всего объясняет связь кода с ситуацией?
R Фрагмент R Копировать
x <- scale(iris[,1:4])
result <- sapply(2:6, function(k) kmeans(x,k,nstart=20)$tot.withinss)
result
Число кластеров выбирают по сочетанию метрик, устойчивости и полезности интерпретации, а не по одному красивому изгибу
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов
Метрика расстояния определяет, что считается похожим; масштаб признаков и их тип напрямую меняют геометрию кластеров
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов
Вопрос 20 из 30
Ситуация: В отчёте выбрано пять сегментов только потому, что эта версия удобнее для маркетинговых названий. Какое заключение лучше всего выдерживает проверку?
R Фрагмент R Копировать
x <- scale(iris[,1:4])
result <- sapply(2:6, function(k) kmeans(x,k,nstart=20)$tot.withinss)
result
Число кластеров выбирают по сочетанию метрик, устойчивости и полезности интерпретации, а не по одному красивому изгибу; поэтому достаточно один раз проверить класс объекта на текущем наборе данных
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов; при этом главный риск состоит в том, что сохранение только меток кластеров не позволяет повторить центры и применить решение к новым данным
Число кластеров выбирают по сочетанию метрик, устойчивости и полезности интерпретации, а не по одному красивому изгибу; при этом главный риск состоит в том, что алгоритм чувствителен к инициализации, выбросам и масштабу, поэтому один запуск может дать случайно слабое решение
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве; при этом главный риск состоит в том, что поиск k на тех же данных и последующая оценка тем же silhouette создают оптимизм выбора без проверки стабильности
Число кластеров выбирают по сочетанию метрик, устойчивости и полезности интерпретации, а не по одному красивому изгибу; при этом главный риск состоит в том, что поиск k на тех же данных и последующая оценка тем же silhouette создают оптимизм выбора без проверки стабильности
Вопрос 21 из 30
Ситуация: Сегменты идеально совпали с двумя лабораториями, использовавшими разные приборы. На какое свойство R здесь следует опереться?
R Фрагмент R Копировать
x <- data.frame(a=c(rnorm(50),rnorm(50,3)), source=rep(c('old','new'),each=50))
result <- table(kmeans(scale(x['a']),2,nstart=20)$cluster, x$source)
result
Иерархическая кластеризация строит дерево объединений, а метод linkage определяет расстояние между кластерами
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов
Метрика расстояния определяет, что считается похожим; масштаб признаков и их тип напрямую меняют геометрию кластеров
Вопрос 22 из 30
Ситуация: Сегменты идеально совпали с двумя лабораториями, использовавшими разные приборы. Почему успешный запуск ещё не доказывает корректность?
R Фрагмент R Копировать
x <- data.frame(a=c(rnorm(50),rnorm(50,3)), source=rep(c('old','new'),each=50))
result <- table(kmeans(scale(x['a']),2,nstart=20)$cluster, x$source)
result
Кластер может отражать источник данных, пакет измерений или пропуски, а не содержательную группу объектов
Признак в тысячах доминирует над признаком в долях при евклидовом расстоянии без стандартизации
single linkage может создавать цепочки, соединяя группы через последовательность промежуточных точек
Алгоритм чувствителен к инициализации, выбросам и масштабу, поэтому один запуск может дать случайно слабое решение
Сохранение только меток кластеров не позволяет повторить центры и применить решение к новым данным
Вопрос 25 из 30
Ситуация: Сегменты идеально совпали с двумя лабораториями, использовавшими разные приборы. Какой вывод точнее всего связывает механизм и главный риск?
R Фрагмент R Копировать
x <- data.frame(a=c(rnorm(50),rnorm(50,3)), source=rep(c('old','new'),each=50))
result <- table(kmeans(scale(x['a']),2,nstart=20)$cluster, x$source)
result
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве; при этом главный риск состоит в том, что алгоритм чувствителен к инициализации, выбросам и масштабу, поэтому один запуск может дать случайно слабое решение
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов; следовательно, совпадение числа строк можно считать полной проверкой решения
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов; при этом главный риск состоит в том, что сохранение только меток кластеров не позволяет повторить центры и применить решение к новым данным
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов; при этом главный риск состоит в том, что кластер может отражать источник данных, пакет измерений или пропуски, а не содержательную группу объектов
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов; при этом главный риск состоит в том, что кластер может отражать источник данных, пакет измерений или пропуски, а не содержательную группу объектов
Вопрос 26 из 30
Ситуация: Через месяц есть только колонка cluster, но нет центров, параметров стандартизации и порядка признаков. Какое утверждение лучше всего объясняет показанный фрагмент?
R Фрагмент R Копировать
set.seed(7)
x <- scale(iris[,1:4])
fit <- kmeans(x,3,nstart=20)
result <- list(centers=fit$centers, scale=attr(x,'scaled:scale'))
result
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве
Иерархическая кластеризация строит дерево объединений, а метод linkage определяет расстояние между кластерами
Метрика расстояния определяет, что считается похожим; масштаб признаков и их тип напрямую меняют геометрию кластеров
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов
Вопрос 27 из 30
Ситуация: Через месяц есть только колонка cluster, но нет центров, параметров стандартизации и порядка признаков. Какое скрытое допущение здесь опаснее остальных?
R Фрагмент R Копировать
set.seed(7)
x <- scale(iris[,1:4])
fit <- kmeans(x,3,nstart=20)
result <- list(centers=fit$centers, scale=attr(x,'scaled:scale'))
result
Сохранение только меток кластеров не позволяет повторить центры и применить решение к новым данным
Признак в тысячах доминирует над признаком в долях при евклидовом расстоянии без стандартизации
Кластер может отражать источник данных, пакет измерений или пропуски, а не содержательную группу объектов
single linkage может создавать цепочки, соединяя группы через последовательность промежуточных точек
Алгоритм чувствителен к инициализации, выбросам и масштабу, поэтому один запуск может дать случайно слабое решение
Вопрос 30 из 30
Ситуация: Через месяц есть только колонка cluster, но нет центров, параметров стандартизации и порядка признаков. Что стоит написать в технической рецензии к этому фрагменту?
R Фрагмент R Копировать
set.seed(7)
x <- scale(iris[,1:4])
fit <- kmeans(x,3,nstart=20)
result <- list(centers=fit$centers, scale=attr(x,'scaled:scale'))
result
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов; при этом главный риск состоит в том, что сохранение только меток кластеров не позволяет повторить центры и применить решение к новым данным
Кластеризация является исследовательской: результат зависит от признаков, расстояния, масштаба и алгоритма и не доказывает существование естественных типов; при этом главный риск состоит в том, что сохранение только меток кластеров не позволяет повторить центры и применить решение к новым данным
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов; при этом главный риск состоит в том, что кластер может отражать источник данных, пакет измерений или пропуски, а не содержательную группу объектов
Воспроизводимая кластеризация фиксирует подготовку признаков, seed, масштабирование, алгоритм, k и способ присвоения новых объектов; поэтому повторный запуск в той же сессии заменяет проверку граничных случаев
k-means минимизирует сумму квадратов расстояний до центроидов и лучше подходит для компактных примерно сферических групп в евклидовом пространстве; при этом главный риск состоит в том, что алгоритм чувствителен к инициализации, выбросам и масштабу, поэтому один запуск может дать случайно слабое решение