💡 Инструкция: Выберите один ответ из пяти. На 30 вопросов отведено 85 минут. Читайте код построчно, учитывайте типы, атрибуты, пропуски и допущения анализа. После завершения откроются общий процент, 6 тематических шкал и объяснение к каждому заданию.
Вопрос 1 из 30
Ситуация: В наборе смешаны миллиметры, километры и бинарный индикатор, а PCA запускают на исходных значениях. Что является главным техническим основанием для разбора?
R Фрагмент R Копировать
x <- data.frame(mm = c(1,2,3,4), km = c(1000,2000,3000,4000), flag = c(0,0,1,1))
result <- prcomp(x, center = TRUE, scale. = FALSE)
result
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование
biplot одновременно показывает проекции наблюдений и направления нагрузок, но длины и углы зависят от выбранного масштабирования
Для применения PCA к новым данным нужно сохранить центр, масштаб, порядок признаков и rotation обученной модели
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии
Вопрос 2 из 30
Ситуация: В наборе смешаны миллиметры, километры и бинарный индикатор, а PCA запускают на исходных значениях. Что именно может сломаться при новых данных?
R Фрагмент R Копировать
x <- data.frame(mm = c(1,2,3,4), km = c(1000,2000,3000,4000), flag = c(0,0,1,1))
result <- prcomp(x, center = TRUE, scale. = FALSE)
result
Повторный prcomp на новых данных создаёт другую систему координат и делает оценки несопоставимыми
Расстояния между стрелками и точками нельзя читать как обычные евклидовы расстояния без знания параметра scale
Знак компоненты произволен: его инверсия не меняет подпространство и не означает противоположный результат анализа
Автоматическое масштабирование бинарных и шумных признаков может дать им непропорционально большой вес
Один выброс способен повернуть компоненты и создать впечатление отдельного направления данных
Вопрос 5 из 30
Ситуация: В наборе смешаны миллиметры, километры и бинарный индикатор, а PCA запускают на исходных значениях. Какое заключение останется верным и на новых данных?
R Фрагмент R Копировать
x <- data.frame(mm = c(1,2,3,4), km = c(1000,2000,3000,4000), flag = c(0,0,1,1))
result <- prcomp(x, center = TRUE, scale. = FALSE)
result
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование; при этом главный риск состоит в том, что повторный prcomp на новых данных создаёт другую систему координат и делает оценки несопоставимыми
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность; при этом главный риск состоит в том, что один выброс способен повернуть компоненты и создать впечатление отдельного направления данных
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование; следовательно, предупреждения можно не учитывать, если итог выглядит ожидаемо
Для применения PCA к новым данным нужно сохранить центр, масштаб, порядок признаков и rotation обученной модели; при этом главный риск состоит в том, что автоматическое масштабирование бинарных и шумных признаков может дать им непропорционально большой вес
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование; при этом главный риск состоит в том, что автоматическое масштабирование бинарных и шумных признаков может дать им непропорционально большой вес
Вопрос 6 из 30
Ситуация: В двух программах нагрузки первой компоненты имеют противоположные знаки, и это объявляют расхождением моделей. Какой принцип непосредственно относится к этому коду?
R Фрагмент R Копировать
fit <- prcomp(USArrests, scale.=TRUE)
result <- crossprod(fit$rotation)
result
Доля объяснённой дисперсии показывает, какую часть общей вариации сохраняют компоненты, но не гарантирует сохранение целевой информации
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность
biplot одновременно показывает проекции наблюдений и направления нагрузок, но длины и углы зависят от выбранного масштабирования
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование
Вопрос 10 из 30
Ситуация: В двух программах нагрузки первой компоненты имеют противоположные знаки, и это объявляют расхождением моделей. Какой итог разбора не смешивает правило языка с впечатлением от результата?
R Фрагмент R Копировать
fit <- prcomp(USArrests, scale.=TRUE)
result <- crossprod(fit$rotation)
result
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии; при этом главный риск состоит в том, что выбор компонентов только по порогу 95% может удалить малодисперсионное направление, важное для классификации
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии; при этом главный риск состоит в том, что знак компоненты произволен: его инверсия не меняет подпространство и не означает противоположный результат анализа
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии; поэтому внешний вид напечатанного объекта важнее происхождения и структуры данных
Доля объяснённой дисперсии показывает, какую часть общей вариации сохраняют компоненты, но не гарантирует сохранение целевой информации; при этом главный риск состоит в том, что знак компоненты произволен: его инверсия не меняет подпространство и не означает противоположный результат анализа
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность; при этом главный риск состоит в том, что один выброс способен повернуть компоненты и создать впечатление отдельного направления данных
Вопрос 11 из 30
Ситуация: Редкий дефект проявляется в слабой компоненте, которую отбрасывают как объясняющую мало общей дисперсии. Какое правило нужно применить к этому фрагменту прежде всего?
R Фрагмент R Копировать
fit <- prcomp(USArrests, scale.=TRUE)
result <- cumsum(fit$sdev^2 / sum(fit$sdev^2))
result
biplot одновременно показывает проекции наблюдений и направления нагрузок, но длины и углы зависят от выбранного масштабирования
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование
Доля объяснённой дисперсии показывает, какую часть общей вариации сохраняют компоненты, но не гарантирует сохранение целевой информации
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность
Вопрос 15 из 30
Ситуация: Редкий дефект проявляется в слабой компоненте, которую отбрасывают как объясняющую мало общей дисперсии. Как сформулировать вывод без лишних обобщений?
R Фрагмент R Копировать
fit <- prcomp(USArrests, scale.=TRUE)
result <- cumsum(fit$sdev^2 / sum(fit$sdev^2))
result
Доля объяснённой дисперсии показывает, какую часть общей вариации сохраняют компоненты, но не гарантирует сохранение целевой информации; при этом главный риск состоит в том, что знак компоненты произволен: его инверсия не меняет подпространство и не означает противоположный результат анализа
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии; при этом главный риск состоит в том, что выбор компонентов только по порогу 95% может удалить малодисперсионное направление, важное для классификации
Доля объяснённой дисперсии показывает, какую часть общей вариации сохраняют компоненты, но не гарантирует сохранение целевой информации; поэтому отсутствие сообщения об ошибке уже подтверждает корректность результата
biplot одновременно показывает проекции наблюдений и направления нагрузок, но длины и углы зависят от выбранного масштабирования; при этом главный риск состоит в том, что расстояния между стрелками и точками нельзя читать как обычные евклидовы расстояния без знания параметра scale
Доля объяснённой дисперсии показывает, какую часть общей вариации сохраняют компоненты, но не гарантирует сохранение целевой информации; при этом главный риск состоит в том, что выбор компонентов только по порогу 95% может удалить малодисперсионное направление, важное для классификации
Вопрос 16 из 30
Ситуация: На biplot делают точный вывод о корреляции, не учитывая, как масштабированы оценки и нагрузки. Какой механизм точнее всего объясняет связь кода с ситуацией?
R Фрагмент R Копировать
fit <- prcomp(iris[,1:4], scale.=TRUE)
result <- list(scores=head(fit$x), loadings=fit$rotation)
result
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии
Для применения PCA к новым данным нужно сохранить центр, масштаб, порядок признаков и rotation обученной модели
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность
biplot одновременно показывает проекции наблюдений и направления нагрузок, но длины и углы зависят от выбранного масштабирования
Вопрос 20 из 30
Ситуация: На biplot делают точный вывод о корреляции, не учитывая, как масштабированы оценки и нагрузки. Какое заключение лучше всего выдерживает проверку?
R Фрагмент R Копировать
fit <- prcomp(iris[,1:4], scale.=TRUE)
result <- list(scores=head(fit$x), loadings=fit$rotation)
result
biplot одновременно показывает проекции наблюдений и направления нагрузок, но длины и углы зависят от выбранного масштабирования; при этом главный риск состоит в том, что расстояния между стрелками и точками нельзя читать как обычные евклидовы расстояния без знания параметра scale
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование; при этом главный риск состоит в том, что расстояния между стрелками и точками нельзя читать как обычные евклидовы расстояния без знания параметра scale
biplot одновременно показывает проекции наблюдений и направления нагрузок, но длины и углы зависят от выбранного масштабирования; поэтому достаточно один раз проверить класс объекта на текущем наборе данных
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии; при этом главный риск состоит в том, что знак компоненты произволен: его инверсия не меняет подпространство и не означает противоположный результат анализа
biplot одновременно показывает проекции наблюдений и направления нагрузок, но длины и углы зависят от выбранного масштабирования; при этом главный риск состоит в том, что автоматическое масштабирование бинарных и шумных признаков может дать им непропорционально большой вес
Вопрос 21 из 30
Ситуация: После добавления одной аномальной записи первая компонента резко меняет направление. На какое свойство R здесь следует опереться?
R Фрагмент R Копировать
x <- rbind(matrix(rnorm(100),ncol=2), c(20,20))
fit <- prcomp(x, scale.=TRUE)
result <- fit$rotation
result
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии
Для применения PCA к новым данным нужно сохранить центр, масштаб, порядок признаков и rotation обученной модели
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование
biplot одновременно показывает проекции наблюдений и направления нагрузок, но длины и углы зависят от выбранного масштабирования
Вопрос 25 из 30
Ситуация: После добавления одной аномальной записи первая компонента резко меняет направление. Какой вывод точнее всего связывает механизм и главный риск?
R Фрагмент R Копировать
x <- rbind(matrix(rnorm(100),ncol=2), c(20,20))
fit <- prcomp(x, scale.=TRUE)
result <- fit$rotation
result
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность; при этом главный риск состоит в том, что один выброс способен повернуть компоненты и создать впечатление отдельного направления данных
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность; при этом главный риск состоит в том, что знак компоненты произволен: его инверсия не меняет подпространство и не означает противоположный результат анализа
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование; при этом главный риск состоит в том, что автоматическое масштабирование бинарных и шумных признаков может дать им непропорционально большой вес
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии; при этом главный риск состоит в том, что один выброс способен повернуть компоненты и создать впечатление отдельного направления данных
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность; следовательно, совпадение числа строк можно считать полной проверкой решения
Вопрос 26 из 30
Ситуация: Каждый месячный пакет данных проходит отдельный PCA, после чего значения PC1 сравнивают по времени. Какое утверждение лучше всего объясняет показанный фрагмент?
R Фрагмент R Копировать
fit <- prcomp(iris[1:100,1:4], scale.=TRUE)
result <- predict(fit, newdata=iris[101:105,1:4])
result
Главные компоненты — ортогональные линейные комбинации исходных признаков, упорядоченные по объяснённой дисперсии
Для применения PCA к новым данным нужно сохранить центр, масштаб, порядок признаков и rotation обученной модели
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование
biplot одновременно показывает проекции наблюдений и направления нагрузок, но длины и углы зависят от выбранного масштабирования
Вопрос 30 из 30
Ситуация: Каждый месячный пакет данных проходит отдельный PCA, после чего значения PC1 сравнивают по времени. Что стоит написать в технической рецензии к этому фрагменту?
R Фрагмент R Копировать
fit <- prcomp(iris[1:100,1:4], scale.=TRUE)
result <- predict(fit, newdata=iris[101:105,1:4])
result
Для применения PCA к новым данным нужно сохранить центр, масштаб, порядок признаков и rotation обученной модели; при этом главный риск состоит в том, что автоматическое масштабирование бинарных и шумных признаков может дать им непропорционально большой вес
Для применения PCA к новым данным нужно сохранить центр, масштаб, порядок признаков и rotation обученной модели; при этом главный риск состоит в том, что повторный prcomp на новых данных создаёт другую систему координат и делает оценки несопоставимыми
PCA чувствителен к выбросам, пропускам, нелинейности и набору признаков и описывает вариацию, а не причинность; при этом главный риск состоит в том, что один выброс способен повернуть компоненты и создать впечатление отдельного направления данных
PCA максимизирует дисперсию, поэтому признаки с большим масштабом доминируют, если не использовать scale. = TRUE или осмысленное преобразование; при этом главный риск состоит в том, что повторный prcomp на новых данных создаёт другую систему координат и делает оценки несопоставимыми
Для применения PCA к новым данным нужно сохранить центр, масштаб, порядок признаков и rotation обученной модели; поэтому повторный запуск в той же сессии заменяет проверку граничных случаев