🤖 ИИ  ·  20 вопросов  ·  ~45 мин  ·  ⏱ Таймер 45:00  ·  Средний  ·  👥 1 прошёл

Данные для обучения модели

Модель редко бывает лучше данных, но фраза «нужно больше данных» слишком груба. Иногда важнее исправить единицы измерения, убрать дубли между выборками, проверить разметку или собрать примеры редкого случая. Тест предлагает исследовать таблицы и конвейеры так, как это делает внимательный аналитик до обучения.

Отвечено: 0 из 20
--:--
0%
💡 Инструкция: Выбери один ответ из четырёх. В тесте 20 вопросов и 45 минут; не меньше половины заданий требуют прочитать код, конфигурацию или формализованную схему. После завершения откроются общий процент, четыре тематические шкалы, правильные ответы и разбор каждого решения.
Вопрос 1 из 20
Компания обучает модель по отзывам только тех клиентов, которые добровольно заполнили длинную анкету. Какой риск наиболее вероятен?
Вопрос 2 из 20
Что не так с этим способом обработки температуры?
Python
rows = [
  {"temperature": 20, "unit": "C"},
  {"temperature": 68, "unit": "F"}
]
mean = sum(r["temperature"] for r in rows) / len(rows)
Вопрос 3 из 20
Два разметчика получили согласие 98%, но 97% примеров относятся к классу «нет дефекта». Почему одной доли согласия недостаточно?
Вопрос 4 из 20
В таблице по одному пользователю есть десятки сессий. Как лучше разделить данные для оценки на новых пользователях?
Python
train_users, test_users = split_unique(users)
train = df[df.user_id.isin(train_users)]
test = df[df.user_id.isin(test_users)]
Вопрос 5 из 20
Почему безусловное заполнение всех пропусков нулём опасно?
Python
for col in numeric_columns:
    df[col] = df[col].fillna(0)
Вопрос 6 из 20
Какое улучшение инструкции разметчикам наиболее полезно?
Вопрос 7 из 20
Почему этот код создаёт утечку между выборками?
Python
train, test = train_test_split(df, test_size=0.2, random_state=7)
train = train.drop_duplicates("text")
test = test.drop_duplicates("text")
Вопрос 8 из 20
Система собирает данные только с устройств новой версии приложения. Что нужно выяснить до обучения?
Вопрос 9 из 20
Какой столбец наиболее подозрителен для прогноза возврата товара до отправки заказа?
Вопрос 10 из 20
Модель получила 99% на test, но выяснилось, что снимки одного пациента делились случайно. Почему результат завышен?
Python
train, test = train_test_split(images, test_size=0.2)
Вопрос 11 из 20
Какой способ помогает обнаружить, что сбор данных пропускает ночные события?
Вопрос 12 из 20
В коде выбросы удаляются по статистикам всей таблицы до split. В чём проблема?
Python
lo, hi = df.amount.quantile([0.01, 0.99])
df = df[df.amount.between(lo, hi)]
train, test = split(df)
Вопрос 13 из 20
Цель — предсказать, нарушил ли водитель правила, но меткой служит наличие выписанного штрафа. Какой риск возникает?
Вопрос 14 из 20
Что делает этот код разумнее простого удаления всех строк с пропусками?
Python
median = train.income.median()
for part in [train, valid, test]:
    part["income_missing"] = part.income.isna().astype(int)
    part["income"] = part.income.fillna(median)
Вопрос 15 из 20
Как проверить, что категория «другое» не скрывает слишком много разных случаев?
Вопрос 16 из 20
Почему агрегат «число покупок за следующие 30 дней» нельзя использовать для прогноза сегодняшнего оттока?
Псевдокод
cutoff = "2026-01-01"
feature = purchases.between(cutoff, cutoff + 30*DAY).count()
label = churn_after(cutoff)
Вопрос 17 из 20
Какой сбор данных лучше для редкого отказа оборудования?
Вопрос 18 из 20
Что покажет этот запрос?
SQL
SELECT event_id, COUNT(*) AS n
FROM events
GROUP BY event_id
HAVING COUNT(*) > 1
ORDER BY n DESC
Вопрос 19 из 20
Какой признак плохой разметочной инструкции виден в таблице?
ТекстФрагмент
example_id  annotator_A  annotator_B
101         sarcasm      negative
114         sarcasm      negative
139         sarcasm      negative
Вопрос 20 из 20
Для прогноза спроса на следующую неделю данные делят случайно по строкам за пять лет. Какой вариант честнее?
Python
train = df[df.date < "2025-01-01"]
test = df[df.date >= "2025-01-01"]

Ответьте на все 20 вопросов, чтобы получить результат

🔗 Встроить тест на свой сайт (iframe)

Скопируйте код и вставьте в любое место на вашем сайте:

Также доступна прямая ссылка на embed-страницу