R R  ·  30 вопросов  ·  ~85 мин  ·  ⏱ Таймер 25:00  ·  Сложный  · 

Перекрёстная проверка и переобучение

Тест построен как последовательность небольших технических расследований. В тесте «Перекрёстная проверка и переобучение» рассматриваются Разделение на обучение и проверку, Перекрёстная проверка, Утечка данных, Выбор модели, Проверка допущений и качества и Воспроизводимость и интерпретация. Нужно предсказывать структуру результата, находить скрытые риски, выбирать исправление и доказывать его проверкой. Из 30 вопросов 18 содержат код; остальные описывают ситуации, в которых синтаксически допустимое решение может привести к неверному аналитическому выводу.

Отвечено: 0 из 30
--:--
0%
💡 Инструкция: Выберите один ответ из пяти. На 30 вопросов отведено 85 минут. Читайте код построчно, учитывайте типы, атрибуты, пропуски и допущения анализа. После завершения откроются общий процент, 6 тематических шкал и объяснение к каждому заданию.
Вопрос 1 из 30
Ситуация: Команда еженедельно меняет признаки, ориентируясь на одну и ту же финальную тестовую метрику. Какой механизм точнее всего объясняет связь кода с ситуацией?
RФрагмент R
set.seed(8)
id <- sample(seq_len(nrow(mtcars)), 22)
result <- list(train=mtcars[id,], test=mtcars[-id,])
result
Вопрос 2 из 30
Ситуация: Команда еженедельно меняет признаки, ориентируясь на одну и ту же финальную тестовую метрику. Какой дефект нужно искать в первую очередь?
RФрагмент R
set.seed(8)
id <- sample(seq_len(nrow(mtcars)), 22)
result <- list(train=mtcars[id,], test=mtcars[-id,])
result
Вопрос 3 из 30
Ситуация: Команда еженедельно меняет признаки, ориентируясь на одну и ту же финальную тестовую метрику. Какой вариант исправления сохраняет смысл анализа?
Вопрос 4 из 30
Ситуация: Команда еженедельно меняет признаки, ориентируясь на одну и ту же финальную тестовую метрику. Какая проверка относится к исходному риску, а не к внешнему виду результата?
Вопрос 5 из 30
Ситуация: Команда еженедельно меняет признаки, ориентируясь на одну и ту же финальную тестовую метрику. Какое заключение лучше всего выдерживает проверку?
RФрагмент R
set.seed(8)
id <- sample(seq_len(nrow(mtcars)), 22)
result <- list(train=mtcars[id,], test=mtcars[-id,])
result
Вопрос 6 из 30
Ситуация: У одного пациента десять снимков; случайное CV распределяет его снимки и в обучение, и в проверку. На какое свойство R здесь следует опереться?
RФрагмент R
set.seed(9)
fold <- sample(rep(1:5,length.out=nrow(iris)))
result <- table(fold, iris$Species)
result
Вопрос 7 из 30
Ситуация: У одного пациента десять снимков; случайное CV распределяет его снимки и в обучение, и в проверку. Почему успешный запуск ещё не доказывает корректность?
RФрагмент R
set.seed(9)
fold <- sample(rep(1:5,length.out=nrow(iris)))
result <- table(fold, iris$Species)
result
Вопрос 8 из 30
Ситуация: У одного пациента десять снимков; случайное CV распределяет его снимки и в обучение, и в проверку. Какая правка лучше локальной заплатки?
Вопрос 9 из 30
Ситуация: У одного пациента десять снимков; случайное CV распределяет его снимки и в обучение, и в проверку. Как подтвердить корректность на граничном случае?
Вопрос 10 из 30
Ситуация: У одного пациента десять снимков; случайное CV распределяет его снимки и в обучение, и в проверку. Какой вывод точнее всего связывает механизм и главный риск?
RФрагмент R
set.seed(9)
fold <- sample(rep(1:5,length.out=nrow(iris)))
result <- table(fold, iris$Species)
result
Вопрос 11 из 30
Ситуация: Весь набор стандартизируют перед CV, а затем считают, что проверочные строки не влияли на модель. Какое утверждение лучше всего объясняет показанный фрагмент?
RФрагмент R
x <- scale(iris[,1:4])
set.seed(10); idx <- sample(1:nrow(x),100)
result <- list(train=x[idx,], test=x[-idx,])
result
Вопрос 12 из 30
Ситуация: Весь набор стандартизируют перед CV, а затем считают, что проверочные строки не влияли на модель. Какое скрытое допущение здесь опаснее остальных?
RФрагмент R
x <- scale(iris[,1:4])
set.seed(10); idx <- sample(1:nrow(x),100)
result <- list(train=x[idx,], test=x[-idx,])
result
Вопрос 13 из 30
Ситуация: Весь набор стандартизируют перед CV, а затем считают, что проверочные строки не влияли на модель. Что нужно сделать, чтобы ошибка не вернулась на следующем наборе данных?
Вопрос 14 из 30
Ситуация: Весь набор стандартизируют перед CV, а затем считают, что проверочные строки не влияли на модель. Какая проверка непосредственно подтверждает, что дефект устранён?
Вопрос 15 из 30
Ситуация: Весь набор стандартизируют перед CV, а затем считают, что проверочные строки не влияли на модель. Что стоит написать в технической рецензии к этому фрагменту?
RФрагмент R
x <- scale(iris[,1:4])
set.seed(10); idx <- sample(1:nrow(x),100)
result <- list(train=x[idx,], test=x[-idx,])
result
Вопрос 16 из 30
Ситуация: Сложнейшую модель выбирают из-за улучшения метрики на 0,001, хотя разброс по folds в десять раз больше. Что является главным техническим основанием для разбора?
RФрагмент R
scores <- c(simple=.182, complex=.179, huge=.178)
se <- c(.006,.008,.015)
result <- data.frame(scores,se)
result
Вопрос 17 из 30
Ситуация: Сложнейшую модель выбирают из-за улучшения метрики на 0,001, хотя разброс по folds в десять раз больше. Что именно может сломаться при новых данных?
RФрагмент R
scores <- c(simple=.182, complex=.179, huge=.178)
se <- c(.006,.008,.015)
result <- data.frame(scores,se)
result
Вопрос 18 из 30
Ситуация: Сложнейшую модель выбирают из-за улучшения метрики на 0,001, хотя разброс по folds в десять раз больше. Какое изменение устраняет именно причину проблемы?
Вопрос 19 из 30
Ситуация: Сложнейшую модель выбирают из-за улучшения метрики на 0,001, хотя разброс по folds в десять раз больше. Какой контроль отличит исправление от случайно удачного результата?
Вопрос 20 из 30
Ситуация: Сложнейшую модель выбирают из-за улучшения метрики на 0,001, хотя разброс по folds в десять раз больше. Какое заключение останется верным и на новых данных?
RФрагмент R
scores <- c(simple=.182, complex=.179, huge=.178)
se <- c(.006,.008,.015)
result <- data.frame(scores,se)
result
Вопрос 21 из 30
Ситуация: В отчёте указана одна точность без размера теста, случайного seed и разбивки по группам. Какой принцип непосредственно относится к этому коду?
RФрагмент R
set.seed(11)
result <- replicate(20, mean(sample(c(0,1),100,replace=TRUE)==sample(c(0,1),100,replace=TRUE)))
result
Вопрос 22 из 30
Ситуация: В отчёте указана одна точность без размера теста, случайного seed и разбивки по группам. Какой риск здесь остаётся главным, даже если результат выглядит правдоподобно?
RФрагмент R
set.seed(11)
result <- replicate(20, mean(sample(c(0,1),100,replace=TRUE)==sample(c(0,1),100,replace=TRUE)))
result
Вопрос 23 из 30
Ситуация: В отчёте указана одна точность без размера теста, случайного seed и разбивки по группам. Какая правка делает решение устойчивым, а не просто удобным на текущем примере?
Вопрос 24 из 30
Ситуация: В отчёте указана одна точность без размера теста, случайного seed и разбивки по группам. Что нужно проверить после правки?
Вопрос 25 из 30
Ситуация: В отчёте указана одна точность без размера теста, случайного seed и разбивки по группам. Какой итог разбора не смешивает правило языка с впечатлением от результата?
RФрагмент R
set.seed(11)
result <- replicate(20, mean(sample(c(0,1),100,replace=TRUE)==sample(c(0,1),100,replace=TRUE)))
result
Вопрос 26 из 30
Ситуация: После обновления пакета CV даёт другую метрику, но старые folds нигде не сохранены. Какое правило нужно применить к этому фрагменту прежде всего?
RФрагмент R
set.seed(12)
folds <- split(sample(seq_len(nrow(iris))), rep(1:5,length.out=nrow(iris)))
result <- lapply(folds, head)
result
Вопрос 27 из 30
Ситуация: После обновления пакета CV даёт другую метрику, но старые folds нигде не сохранены. Что в этой ситуации способно исказить вывод без явной синтаксической ошибки?
RФрагмент R
set.seed(12)
folds <- split(sample(seq_len(nrow(iris))), rep(1:5,length.out=nrow(iris)))
result <- lapply(folds, head)
result
Вопрос 28 из 30
Ситуация: После обновления пакета CV даёт другую метрику, но старые folds нигде не сохранены. Что следует изменить в коде или процессе?
Вопрос 29 из 30
Ситуация: После обновления пакета CV даёт другую метрику, но старые folds нигде не сохранены. Какой тест лучше всего ловит повтор этой ошибки?
Вопрос 30 из 30
Ситуация: После обновления пакета CV даёт другую метрику, но старые folds нигде не сохранены. Как сформулировать вывод без лишних обобщений?
RФрагмент R
set.seed(12)
folds <- split(sample(seq_len(nrow(iris))), rep(1:5,length.out=nrow(iris)))
result <- lapply(folds, head)
result

Ответьте на все 30 вопросов, чтобы получить результат

🔗 Встроить тест на свой сайт (iframe)

Скопируйте код и вставьте в любое место на вашем сайте:

Также доступна прямая ссылка на embed-страницу