💡 Инструкция: Выберите один ответ из пяти. На 30 вопросов отведено 85 минут. Читайте код построчно, учитывайте типы, атрибуты, пропуски и допущения анализа. После завершения откроются общий процент, 6 тематических шкал и объяснение к каждому заданию.
Вопрос 1 из 30
Ситуация: Сервис оценивает вероятность отказа, но модель иногда выдаёт -0,2 и 1,1. Какой механизм точнее всего объясняет связь кода с ситуацией?
R Фрагмент R Копировать
df <- data.frame(y = c(0,0,1,1,1), x = 1:5)
fit <- lm(y ~ x, data = df)
result <- predict(fit, newdata = data.frame(x = c(0, 7)))
result
Качество GLM требует проверки формы связи, разделения классов, переобучения, калибровки и соответствия распределения данным
deviance сравнивает правдоподобие модели с насыщенной моделью и полезна для сопоставления вложенных спецификаций при корректных предпосылках
link-функция связывает условное среднее отклика с линейным предиктором и выбирается вместе с семейством распределения
exp(beta) в логистической модели — множитель отношения шансов при увеличении предиктора на единицу при фиксированных остальных переменных
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования
Вопрос 2 из 30
Ситуация: Сервис оценивает вероятность отказа, но модель иногда выдаёт -0,2 и 1,1. Какой дефект нужно искать в первую очередь?
R Фрагмент R Копировать
df <- data.frame(y = c(0,0,1,1,1), x = 1:5)
fit <- lm(y ~ x, data = df)
result <- predict(fit, newdata = data.frame(x = c(0, 7)))
result
Отношение шансов нельзя безусловно называть отношением вероятностей, особенно когда событие частое
Подгонка обычной линейной модели к нулям и единицам допускает прогнозы вне диапазона и неверную структуру дисперсии
Меньшая deviance сама по себе не оправдывает любую сложность и не заменяет проверку на новых данных
Высокая точность при редком событии может быть достигнута моделью, всегда выбирающей отрицательный класс
Интерпретация коэффициента на шкале отклика без обратного преобразования делает эффект количественно неверным
Вопрос 4 из 30
Ситуация: Сервис оценивает вероятность отказа, но модель иногда выдаёт -0,2 и 1,1. Какая проверка относится к исходному риску, а не к внешнему виду результата?
Сравните baseline, confusion matrix, calibration curve и метрики на независимой выборке
Сравните predict(..., type='link') и type='response' на нескольких значениях предиктора
Проверьте уровни отклика, диапазон прогнозов, калибровку и качество на независимых данных
Проверьте разность deviance, степени свободы, AIC и ошибку на holdout
Вычислите вероятности для двух значений предиктора и сравните их с exp(coef)
Вопрос 5 из 30
Ситуация: Сервис оценивает вероятность отказа, но модель иногда выдаёт -0,2 и 1,1. Какое заключение лучше всего выдерживает проверку?
R Фрагмент R Копировать
df <- data.frame(y = c(0,0,1,1,1), x = 1:5)
fit <- lm(y ~ x, data = df)
result <- predict(fit, newdata = data.frame(x = c(0, 7)))
result
exp(beta) в логистической модели — множитель отношения шансов при увеличении предиктора на единицу при фиксированных остальных переменных; при этом главный риск состоит в том, что подгонка обычной линейной модели к нулям и единицам допускает прогнозы вне диапазона и неверную структуру дисперсии
link-функция связывает условное среднее отклика с линейным предиктором и выбирается вместе с семейством распределения; при этом главный риск состоит в том, что интерпретация коэффициента на шкале отклика без обратного преобразования делает эффект количественно неверным
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования; при этом главный риск состоит в том, что отношение шансов нельзя безусловно называть отношением вероятностей, особенно когда событие частое
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования; поэтому достаточно один раз проверить класс объекта на текущем наборе данных
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования; при этом главный риск состоит в том, что подгонка обычной линейной модели к нулям и единицам допускает прогнозы вне диапазона и неверную структуру дисперсии
Вопрос 6 из 30
Ситуация: Коэффициент логистической модели называют прямым изменением вероятности на каждую единицу веса. На какое свойство R здесь следует опереться?
R Фрагмент R Копировать
fit <- glm(am ~ wt, data=mtcars, family=binomial(link='logit'))
result <- c(link=predict(fit,newdata=data.frame(wt=3),type='link'), prob=predict(fit,newdata=data.frame(wt=3),type='response'))
result
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования
link-функция связывает условное среднее отклика с линейным предиктором и выбирается вместе с семейством распределения
exp(beta) в логистической модели — множитель отношения шансов при увеличении предиктора на единицу при фиксированных остальных переменных
deviance сравнивает правдоподобие модели с насыщенной моделью и полезна для сопоставления вложенных спецификаций при корректных предпосылках
Воспроизводимый GLM фиксирует данные, формулу, кодирование факторов, версии пакетов, порог решения и способ оценки
Вопрос 10 из 30
Ситуация: Коэффициент логистической модели называют прямым изменением вероятности на каждую единицу веса. Какой вывод точнее всего связывает механизм и главный риск?
R Фрагмент R Копировать
fit <- glm(am ~ wt, data=mtcars, family=binomial(link='logit'))
result <- c(link=predict(fit,newdata=data.frame(wt=3),type='link'), prob=predict(fit,newdata=data.frame(wt=3),type='response'))
result
link-функция связывает условное среднее отклика с линейным предиктором и выбирается вместе с семейством распределения; следовательно, совпадение числа строк можно считать полной проверкой решения
link-функция связывает условное среднее отклика с линейным предиктором и выбирается вместе с семейством распределения; при этом главный риск состоит в том, что интерпретация коэффициента на шкале отклика без обратного преобразования делает эффект количественно неверным
link-функция связывает условное среднее отклика с линейным предиктором и выбирается вместе с семейством распределения; при этом главный риск состоит в том, что отношение шансов нельзя безусловно называть отношением вероятностей, особенно когда событие частое
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования; при этом главный риск состоит в том, что подгонка обычной линейной модели к нулям и единицам допускает прогнозы вне диапазона и неверную структуру дисперсии
exp(beta) в логистической модели — множитель отношения шансов при увеличении предиктора на единицу при фиксированных остальных переменных; при этом главный риск состоит в том, что интерпретация коэффициента на шкале отклика без обратного преобразования делает эффект количественно неверным
Вопрос 11 из 30
Ситуация: Добавление десятка признаков снизило deviance, и модель объявили лучше без проверки переобучения. Какое утверждение лучше всего объясняет показанный фрагмент?
R Фрагмент R Копировать
m0 <- glm(am ~ 1, data=mtcars, family=binomial)
m1 <- glm(am ~ wt + hp, data=mtcars, family=binomial)
result <- anova(m0, m1, test='Chisq')
result
exp(beta) в логистической модели — множитель отношения шансов при увеличении предиктора на единицу при фиксированных остальных переменных
Воспроизводимый GLM фиксирует данные, формулу, кодирование факторов, версии пакетов, порог решения и способ оценки
Качество GLM требует проверки формы связи, разделения классов, переобучения, калибровки и соответствия распределения данным
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования
deviance сравнивает правдоподобие модели с насыщенной моделью и полезна для сопоставления вложенных спецификаций при корректных предпосылках
Вопрос 12 из 30
Ситуация: Добавление десятка признаков снизило deviance, и модель объявили лучше без проверки переобучения. Какое скрытое допущение здесь опаснее остальных?
R Фрагмент R Копировать
m0 <- glm(am ~ 1, data=mtcars, family=binomial)
m1 <- glm(am ~ wt + hp, data=mtcars, family=binomial)
result <- anova(m0, m1, test='Chisq')
result
Изменение базового уровня фактора меняет вид коэффициентов и может создать ложное впечатление, что модель стала другой
Подгонка обычной линейной модели к нулям и единицам допускает прогнозы вне диапазона и неверную структуру дисперсии
Меньшая deviance сама по себе не оправдывает любую сложность и не заменяет проверку на новых данных
Отношение шансов нельзя безусловно называть отношением вероятностей, особенно когда событие частое
Высокая точность при редком событии может быть достигнута моделью, всегда выбирающей отрицательный класс
Вопрос 15 из 30
Ситуация: Добавление десятка признаков снизило deviance, и модель объявили лучше без проверки переобучения. Что стоит написать в технической рецензии к этому фрагменту?
R Фрагмент R Копировать
m0 <- glm(am ~ 1, data=mtcars, family=binomial)
m1 <- glm(am ~ wt + hp, data=mtcars, family=binomial)
result <- anova(m0, m1, test='Chisq')
result
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования; при этом главный риск состоит в том, что подгонка обычной линейной модели к нулям и единицам допускает прогнозы вне диапазона и неверную структуру дисперсии
Качество GLM требует проверки формы связи, разделения классов, переобучения, калибровки и соответствия распределения данным; при этом главный риск состоит в том, что меньшая deviance сама по себе не оправдывает любую сложность и не заменяет проверку на новых данных
deviance сравнивает правдоподобие модели с насыщенной моделью и полезна для сопоставления вложенных спецификаций при корректных предпосылках; поэтому повторный запуск в той же сессии заменяет проверку граничных случаев
deviance сравнивает правдоподобие модели с насыщенной моделью и полезна для сопоставления вложенных спецификаций при корректных предпосылках; при этом главный риск состоит в том, что меньшая deviance сама по себе не оправдывает любую сложность и не заменяет проверку на новых данных
deviance сравнивает правдоподобие модели с насыщенной моделью и полезна для сопоставления вложенных спецификаций при корректных предпосылках; при этом главный риск состоит в том, что высокая точность при редком событии может быть достигнута моделью, всегда выбирающей отрицательный класс
Вопрос 20 из 30
Ситуация: Событие встречается у половины объектов, но отношение шансов 2 трактуют как удвоение вероятности. Какое заключение останется верным и на новых данных?
R Фрагмент R Копировать
fit <- glm(am ~ wt, data=mtcars, family=binomial)
result <- exp(coef(fit)['wt'])
result
exp(beta) в логистической модели — множитель отношения шансов при увеличении предиктора на единицу при фиксированных остальных переменных; при этом главный риск состоит в том, что подгонка обычной линейной модели к нулям и единицам допускает прогнозы вне диапазона и неверную структуру дисперсии
exp(beta) в логистической модели — множитель отношения шансов при увеличении предиктора на единицу при фиксированных остальных переменных; следовательно, предупреждения можно не учитывать, если итог выглядит ожидаемо
exp(beta) в логистической модели — множитель отношения шансов при увеличении предиктора на единицу при фиксированных остальных переменных; при этом главный риск состоит в том, что отношение шансов нельзя безусловно называть отношением вероятностей, особенно когда событие частое
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования; при этом главный риск состоит в том, что отношение шансов нельзя безусловно называть отношением вероятностей, особенно когда событие частое
link-функция связывает условное среднее отклика с линейным предиктором и выбирается вместе с семейством распределения; при этом главный риск состоит в том, что интерпретация коэффициента на шкале отклика без обратного преобразования делает эффект количественно неверным
Вопрос 21 из 30
Ситуация: Модель редкого дефекта имеет 99% точности, но не находит ни одного дефектного объекта. Какой принцип непосредственно относится к этому коду?
R Фрагмент R Копировать
fit <- glm(vs ~ mpg + wt, data=mtcars, family=binomial)
p <- predict(fit,type='response')
result <- table(actual=mtcars$vs, predicted=p>.5)
result
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования
Воспроизводимый GLM фиксирует данные, формулу, кодирование факторов, версии пакетов, порог решения и способ оценки
link-функция связывает условное среднее отклика с линейным предиктором и выбирается вместе с семейством распределения
Качество GLM требует проверки формы связи, разделения классов, переобучения, калибровки и соответствия распределения данным
deviance сравнивает правдоподобие модели с насыщенной моделью и полезна для сопоставления вложенных спецификаций при корректных предпосылках
Вопрос 25 из 30
Ситуация: Модель редкого дефекта имеет 99% точности, но не находит ни одного дефектного объекта. Какой итог разбора не смешивает правило языка с впечатлением от результата?
R Фрагмент R Копировать
fit <- glm(vs ~ mpg + wt, data=mtcars, family=binomial)
p <- predict(fit,type='response')
result <- table(actual=mtcars$vs, predicted=p>.5)
result
Качество GLM требует проверки формы связи, разделения классов, переобучения, калибровки и соответствия распределения данным; при этом главный риск состоит в том, что высокая точность при редком событии может быть достигнута моделью, всегда выбирающей отрицательный класс
Качество GLM требует проверки формы связи, разделения классов, переобучения, калибровки и соответствия распределения данным; поэтому внешний вид напечатанного объекта важнее происхождения и структуры данных
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования; при этом главный риск состоит в том, что подгонка обычной линейной модели к нулям и единицам допускает прогнозы вне диапазона и неверную структуру дисперсии
deviance сравнивает правдоподобие модели с насыщенной моделью и полезна для сопоставления вложенных спецификаций при корректных предпосылках; при этом главный риск состоит в том, что высокая точность при редком событии может быть достигнута моделью, всегда выбирающей отрицательный класс
Качество GLM требует проверки формы связи, разделения классов, переобучения, калибровки и соответствия распределения данным; при этом главный риск состоит в том, что меньшая deviance сама по себе не оправдывает любую сложность и не заменяет проверку на новых данных
Вопрос 26 из 30
Ситуация: Через месяц отчёт строится с другим базовым уровнем категории, и названия эффектов меняются местами. Какое правило нужно применить к этому фрагменту прежде всего?
R Фрагмент R Копировать
d <- mtcars; d$cyl <- factor(d$cyl)
fit <- glm(am ~ cyl + wt, data=d, family=binomial)
result <- list(levels=levels(d$cyl), coef=coef(fit))
result
Логистическая регрессия моделирует логарифм отношения шансов бинарного события и возвращает вероятности после обратного преобразования
Воспроизводимый GLM фиксирует данные, формулу, кодирование факторов, версии пакетов, порог решения и способ оценки
deviance сравнивает правдоподобие модели с насыщенной моделью и полезна для сопоставления вложенных спецификаций при корректных предпосылках
Качество GLM требует проверки формы связи, разделения классов, переобучения, калибровки и соответствия распределения данным
link-функция связывает условное среднее отклика с линейным предиктором и выбирается вместе с семейством распределения
Вопрос 30 из 30
Ситуация: Через месяц отчёт строится с другим базовым уровнем категории, и названия эффектов меняются местами. Как сформулировать вывод без лишних обобщений?
R Фрагмент R Копировать
d <- mtcars; d$cyl <- factor(d$cyl)
fit <- glm(am ~ cyl + wt, data=d, family=binomial)
result <- list(levels=levels(d$cyl), coef=coef(fit))
result
Воспроизводимый GLM фиксирует данные, формулу, кодирование факторов, версии пакетов, порог решения и способ оценки; при этом главный риск состоит в том, что изменение базового уровня фактора меняет вид коэффициентов и может создать ложное впечатление, что модель стала другой
Воспроизводимый GLM фиксирует данные, формулу, кодирование факторов, версии пакетов, порог решения и способ оценки; при этом главный риск состоит в том, что высокая точность при редком событии может быть достигнута моделью, всегда выбирающей отрицательный класс
Качество GLM требует проверки формы связи, разделения классов, переобучения, калибровки и соответствия распределения данным; при этом главный риск состоит в том, что изменение базового уровня фактора меняет вид коэффициентов и может создать ложное впечатление, что модель стала другой
Воспроизводимый GLM фиксирует данные, формулу, кодирование факторов, версии пакетов, порог решения и способ оценки; поэтому отсутствие сообщения об ошибке уже подтверждает корректность результата
link-функция связывает условное среднее отклика с линейным предиктором и выбирается вместе с семейством распределения; при этом главный риск состоит в том, что интерпретация коэффициента на шкале отклика без обратного преобразования делает эффект количественно неверным