💡 Инструкция: Выберите один ответ из пяти. На 30 вопросов отведено 85 минут. Читайте код построчно, учитывайте типы, атрибуты, пропуски и допущения анализа. После завершения откроются общий процент, 6 тематических шкал и объяснение к каждому заданию.
Вопрос 1 из 30
Ситуация: Команда еженедельно меняет признаки, ориентируясь на одну и ту же финальную тестовую метрику. Какой механизм точнее всего объясняет связь кода с ситуацией?
R Фрагмент R Копировать
set.seed(8)
id <- sample(seq_len(nrow(mtcars)), 22)
result <- list(train=mtcars[id,], test=mtcars[-id,])
result
Утечка возникает, когда при обучении используется информация, недоступная в момент реального прогноза, включая статистики всей выборки
Тестовая выборка должна имитировать будущие данные и оставаться невидимой до окончательной оценки модели
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям
Воспроизводимая CV фиксирует folds, seed, preprocessing, метрику, пространство настройки и правило выбора победителя
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями
Вопрос 5 из 30
Ситуация: Команда еженедельно меняет признаки, ориентируясь на одну и ту же финальную тестовую метрику. Какое заключение лучше всего выдерживает проверку?
R Фрагмент R Копировать
set.seed(8)
id <- sample(seq_len(nrow(mtcars)), 22)
result <- list(train=mtcars[id,], test=mtcars[-id,])
result
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями; при этом главный риск состоит в том, что многократный выбор модели по результату на test превращает тестовую выборку в часть обучения
Тестовая выборка должна имитировать будущие данные и оставаться невидимой до окончательной оценки модели; при этом главный риск состоит в том, что многократный выбор модели по результату на test превращает тестовую выборку в часть обучения
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям; при этом главный риск состоит в том, что случайные folds нарушают зависимость групп или времени и позволяют связанным наблюдениям попасть по обе стороны
Тестовая выборка должна имитировать будущие данные и оставаться невидимой до окончательной оценки модели; поэтому достаточно один раз проверить класс объекта на текущем наборе данных
Тестовая выборка должна имитировать будущие данные и оставаться невидимой до окончательной оценки модели; при этом главный риск состоит в том, что поиск среди сотен конфигураций без вложенной оценки выбирает случайно удачную модель и завышает качество
Вопрос 6 из 30
Ситуация: У одного пациента десять снимков; случайное CV распределяет его снимки и в обучение, и в проверку. На какое свойство R здесь следует опереться?
R Фрагмент R Копировать
set.seed(9)
fold <- sample(rep(1:5,length.out=nrow(iris)))
result <- table(fold, iris$Species)
result
Оценка обобщения зависит от репрезентативности разделения, метрики, базовой модели и доверительного интервала ошибки
Утечка возникает, когда при обучении используется информация, недоступная в момент реального прогноза, включая статистики всей выборки
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями
Воспроизводимая CV фиксирует folds, seed, preprocessing, метрику, пространство настройки и правило выбора победителя
Вопрос 10 из 30
Ситуация: У одного пациента десять снимков; случайное CV распределяет его снимки и в обучение, и в проверку. Какой вывод точнее всего связывает механизм и главный риск?
R Фрагмент R Копировать
set.seed(9)
fold <- sample(rep(1:5,length.out=nrow(iris)))
result <- table(fold, iris$Species)
result
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям; при этом главный риск состоит в том, что нормализация до разделения передаёт в обучение среднее и разброс тестовых данных
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям; следовательно, совпадение числа строк можно считать полной проверкой решения
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями; при этом главный риск состоит в том, что поиск среди сотен конфигураций без вложенной оценки выбирает случайно удачную модель и завышает качество
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям; при этом главный риск состоит в том, что случайные folds нарушают зависимость групп или времени и позволяют связанным наблюдениям попасть по обе стороны
Утечка возникает, когда при обучении используется информация, недоступная в момент реального прогноза, включая статистики всей выборки; при этом главный риск состоит в том, что случайные folds нарушают зависимость групп или времени и позволяют связанным наблюдениям попасть по обе стороны
Вопрос 11 из 30
Ситуация: Весь набор стандартизируют перед CV, а затем считают, что проверочные строки не влияли на модель. Какое утверждение лучше всего объясняет показанный фрагмент?
R Фрагмент R Копировать
x <- scale(iris[,1:4])
set.seed(10); idx <- sample(1:nrow(x),100)
result <- list(train=x[idx,], test=x[-idx,])
result
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям
Тестовая выборка должна имитировать будущие данные и оставаться невидимой до окончательной оценки модели
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями
Воспроизводимая CV фиксирует folds, seed, preprocessing, метрику, пространство настройки и правило выбора победителя
Утечка возникает, когда при обучении используется информация, недоступная в момент реального прогноза, включая статистики всей выборки
Вопрос 15 из 30
Ситуация: Весь набор стандартизируют перед CV, а затем считают, что проверочные строки не влияли на модель. Что стоит написать в технической рецензии к этому фрагменту?
R Фрагмент R Копировать
x <- scale(iris[,1:4])
set.seed(10); idx <- sample(1:nrow(x),100)
result <- list(train=x[idx,], test=x[-idx,])
result
Утечка возникает, когда при обучении используется информация, недоступная в момент реального прогноза, включая статистики всей выборки; поэтому повторный запуск в той же сессии заменяет проверку граничных случаев
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям; при этом главный риск состоит в том, что нормализация до разделения передаёт в обучение среднее и разброс тестовых данных
Утечка возникает, когда при обучении используется информация, недоступная в момент реального прогноза, включая статистики всей выборки; при этом главный риск состоит в том, что случайные folds нарушают зависимость групп или времени и позволяют связанным наблюдениям попасть по обе стороны
Утечка возникает, когда при обучении используется информация, недоступная в момент реального прогноза, включая статистики всей выборки; при этом главный риск состоит в том, что нормализация до разделения передаёт в обучение среднее и разброс тестовых данных
Воспроизводимая CV фиксирует folds, seed, preprocessing, метрику, пространство настройки и правило выбора победителя; при этом главный риск состоит в том, что одинаковый seed не гарантирует повтор, если версии библиотек или порядок данных меняют генерацию folds
Вопрос 16 из 30
Ситуация: Сложнейшую модель выбирают из-за улучшения метрики на 0,001, хотя разброс по folds в десять раз больше. Что является главным техническим основанием для разбора?
R Фрагмент R Копировать
scores <- c(simple=.182, complex=.179, huge=.178)
se <- c(.006,.008,.015)
result <- data.frame(scores,se)
result
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям
Утечка возникает, когда при обучении используется информация, недоступная в момент реального прогноза, включая статистики всей выборки
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями
Тестовая выборка должна имитировать будущие данные и оставаться невидимой до окончательной оценки модели
Воспроизводимая CV фиксирует folds, seed, preprocessing, метрику, пространство настройки и правило выбора победителя
Вопрос 20 из 30
Ситуация: Сложнейшую модель выбирают из-за улучшения метрики на 0,001, хотя разброс по folds в десять раз больше. Какое заключение останется верным и на новых данных?
R Фрагмент R Копировать
scores <- c(simple=.182, complex=.179, huge=.178)
se <- c(.006,.008,.015)
result <- data.frame(scores,se)
result
Тестовая выборка должна имитировать будущие данные и оставаться невидимой до окончательной оценки модели; при этом главный риск состоит в том, что поиск среди сотен конфигураций без вложенной оценки выбирает случайно удачную модель и завышает качество
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям; при этом главный риск состоит в том, что случайные folds нарушают зависимость групп или времени и позволяют связанным наблюдениям попасть по обе стороны
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями; следовательно, предупреждения можно не учитывать, если итог выглядит ожидаемо
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями; при этом главный риск состоит в том, что многократный выбор модели по результату на test превращает тестовую выборку в часть обучения
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями; при этом главный риск состоит в том, что поиск среди сотен конфигураций без вложенной оценки выбирает случайно удачную модель и завышает качество
Вопрос 21 из 30
Ситуация: В отчёте указана одна точность без размера теста, случайного seed и разбивки по группам. Какой принцип непосредственно относится к этому коду?
R Фрагмент R Копировать
set.seed(11)
result <- replicate(20, mean(sample(c(0,1),100,replace=TRUE)==sample(c(0,1),100,replace=TRUE)))
result
Утечка возникает, когда при обучении используется информация, недоступная в момент реального прогноза, включая статистики всей выборки
Воспроизводимая CV фиксирует folds, seed, preprocessing, метрику, пространство настройки и правило выбора победителя
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям
Оценка обобщения зависит от репрезентативности разделения, метрики, базовой модели и доверительного интервала ошибки
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями
Вопрос 22 из 30
Ситуация: В отчёте указана одна точность без размера теста, случайного seed и разбивки по группам. Какой риск здесь остаётся главным, даже если результат выглядит правдоподобно?
R Фрагмент R Копировать
set.seed(11)
result <- replicate(20, mean(sample(c(0,1),100,replace=TRUE)==sample(c(0,1),100,replace=TRUE)))
result
Случайно высокий результат одного split может скрывать нестабильность по сегментам и времени
Нормализация до разделения передаёт в обучение среднее и разброс тестовых данных
Случайные folds нарушают зависимость групп или времени и позволяют связанным наблюдениям попасть по обе стороны
Одинаковый seed не гарантирует повтор, если версии библиотек или порядок данных меняют генерацию folds
Поиск среди сотен конфигураций без вложенной оценки выбирает случайно удачную модель и завышает качество
Вопрос 25 из 30
Ситуация: В отчёте указана одна точность без размера теста, случайного seed и разбивки по группам. Какой итог разбора не смешивает правило языка с впечатлением от результата?
R Фрагмент R Копировать
set.seed(11)
result <- replicate(20, mean(sample(c(0,1),100,replace=TRUE)==sample(c(0,1),100,replace=TRUE)))
result
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями; при этом главный риск состоит в том, что поиск среди сотен конфигураций без вложенной оценки выбирает случайно удачную модель и завышает качество
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям; при этом главный риск состоит в том, что случайно высокий результат одного split может скрывать нестабильность по сегментам и времени
Оценка обобщения зависит от репрезентативности разделения, метрики, базовой модели и доверительного интервала ошибки; при этом главный риск состоит в том, что случайно высокий результат одного split может скрывать нестабильность по сегментам и времени
Оценка обобщения зависит от репрезентативности разделения, метрики, базовой модели и доверительного интервала ошибки; при этом главный риск состоит в том, что случайные folds нарушают зависимость групп или времени и позволяют связанным наблюдениям попасть по обе стороны
Оценка обобщения зависит от репрезентативности разделения, метрики, базовой модели и доверительного интервала ошибки; поэтому внешний вид напечатанного объекта важнее происхождения и структуры данных
Вопрос 26 из 30
Ситуация: После обновления пакета CV даёт другую метрику, но старые folds нигде не сохранены. Какое правило нужно применить к этому фрагменту прежде всего?
R Фрагмент R Копировать
set.seed(12)
folds <- split(sample(seq_len(nrow(iris))), rep(1:5,length.out=nrow(iris)))
result <- lapply(folds, head)
result
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями
Утечка возникает, когда при обучении используется информация, недоступная в момент реального прогноза, включая статистики всей выборки
Оценка обобщения зависит от репрезентативности разделения, метрики, базовой модели и доверительного интервала ошибки
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям
Воспроизводимая CV фиксирует folds, seed, preprocessing, метрику, пространство настройки и правило выбора победителя
Вопрос 30 из 30
Ситуация: После обновления пакета CV даёт другую метрику, но старые folds нигде не сохранены. Как сформулировать вывод без лишних обобщений?
R Фрагмент R Копировать
set.seed(12)
folds <- split(sample(seq_len(nrow(iris))), rep(1:5,length.out=nrow(iris)))
result <- lapply(folds, head)
result
Воспроизводимая CV фиксирует folds, seed, preprocessing, метрику, пространство настройки и правило выбора победителя; при этом главный риск состоит в том, что одинаковый seed не гарантирует повтор, если версии библиотек или порядок данных меняют генерацию folds
Выбор модели должен учитывать среднюю ошибку, неопределённость, сложность, стоимость и устойчивость, а не минимальную цифру с тысячными долями; при этом главный риск состоит в том, что одинаковый seed не гарантирует повтор, если версии библиотек или порядок данных меняют генерацию folds
k-fold CV обучает модель k раз, каждый раз оставляя один fold для оценки, и усредняет ошибки по невиденным наблюдениям; при этом главный риск состоит в том, что случайные folds нарушают зависимость групп или времени и позволяют связанным наблюдениям попасть по обе стороны
Воспроизводимая CV фиксирует folds, seed, preprocessing, метрику, пространство настройки и правило выбора победителя; при этом главный риск состоит в том, что поиск среди сотен конфигураций без вложенной оценки выбирает случайно удачную модель и завышает качество
Воспроизводимая CV фиксирует folds, seed, preprocessing, метрику, пространство настройки и правило выбора победителя; поэтому отсутствие сообщения об ошибке уже подтверждает корректность результата