🤖 ИИ  ·  20 вопросов  ·  ~45 мин  ·  ⏱ Таймер 45:00  ·  Средний  · 

Обработка естественного языка

Работа с текстом начинается не с выбора большой модели, а с точной постановки задачи: что считать единицей текста, какую информацию сохранить, как учесть контекст и чем измерить качество. В тесте встречаются токенизация, представления текста, классификация, извлечение сущностей, поиск и генерация — в виде кода, разметки и производственных ситуаций.

Отвечено: 0 из 20
⏱ --:--
0%
💡 Инструкция: Выбери один ответ из четырёх. В тесте 20 вопросов и 45 минут; не меньше половины заданий требуют прочитать код, конфигурацию или формализованную схему. После завершения откроются общий процент, четыре тематические шкалы, правильные ответы и разбор каждого решения.
Вопрос 1 из 20
Сервис должен подсвечивать фамилию в исходной строке. После токенизации найден индекс токена, но подсветка сдвигается на два символа. Какое дополнение к токенизатору решает именно эту проблему?
Python
text = "Письмо для Анны-Марии Петровой"
tokens = ['Письмо', 'для', 'Анны', '-', 'Марии', 'Петровой']
Вопрос 2 из 20
Почему два предложения получают одинаковый bag-of-words, хотя смысл различается?
Python
a = "собака укусила человека"
b = "человек укусил собаку"
Вопрос 3 из 20
Нужно отметить в договоре каждое упоминание организации и его границы. Какая постановка ближе всего к задаче?
Вопрос 4 из 20
Модель распознавания адресов показывает F1=0,94 на случайном разделении строк. В данных много копий одного шаблона договора. Какой контроль наиболее важен перед выпуском?
Python
train, test = train_test_split(rows, test_size=.2, random_state=42)
Вопрос 5 из 20
В поиске слово встречается почти во всех документах коллекции. Как TF–IDF отнесётся к нему по сравнению со словом, встречающимся лишь в нескольких документах?
\operatorname{tfidf}(t,d)=\operatorname{tf}(t,d)\log\frac{N}{df(t)}
Python
idf = log(N / document_frequency)
tfidf = term_frequency * idf
Вопрос 6 из 20
Чат поддержки должен определить тему обращения и направить его в отдел. Что является целевым выходом для базовой модели?
ТекстПример разметки
input:  "После оплаты заказ исчез из кабинета"
output: "платежи_и_заказы"
Вопрос 7 из 20
В классе «угроза безопасности» всего 1% сообщений. Accuracy модели равна 99%, но она ни разу не нашла угрозу. Какой вывод верен?
Python
y_true = [0]*990 + [1]*10
y_pred = [0]*1000
Вопрос 8 из 20
Токенизатор обучили на обычных словах, а в новых данных много артикулов вида AB-1037/К. Какой признак указывает, что разбиение стало проблемой?
Вопрос 9 из 20
Система должна ответить на вопрос только фрагментом из переданного документа. Какой тип задачи лучше описывает требование?
Python
context = "Доставка занимает от трёх до пяти рабочих дней."
question = "Сколько длится доставка?"
answer_start, answer_end = model(context, question)
Вопрос 10 из 20
Автоматическая метрика суммаризации высока, но редакторы жалуются на неверные числа. Что делать прежде всего?
ТекстПример ошибки
source:  "Выручка выросла с 8 до 11 млн рублей"
summary: "Выручка выросла до 18 млн рублей"
Вопрос 11 из 20
Почему простое `.lower()` может быть нежелательно для задачи распознавания аббревиатур и имён?
Python
examples = ["Мир", "МИР", "мир"]
normalized = [x.lower() for x in examples]
Вопрос 12 из 20
Чем контекстное представление слова «ключ» полезнее одного фиксированного вектора?
Вопрос 13 из 20
В NER модель верно находит начало названия, но часто обрезает последнее слово. Какая проверка точнее всего покажет проблему?
Python
true = [(14, 39, "ORG")]
pred = [(14, 31, "ORG")]
Вопрос 14 из 20
После удаления пунктуации строка «Оплатить нельзя, отменить» стала двусмысленной. Какой вывод для подготовки данных наиболее точен?
Вопрос 15 из 20
Для семантического поиска запрос «как вернуть деньги» не содержит слов из документа «порядок оформления возврата средств». Какое представление способно сблизить их по смыслу?
Python
q_vec = encoder.encode("как вернуть деньги")
d_vec = encoder.encode("порядок оформления возврата средств")
score = cosine(q_vec, d_vec)
Вопрос 16 из 20
Нужно извлечь из письма отправителя, сумму счёта и срок оплаты. Почему один генеративный ответ без схемы неудобен для последующей программы?
JSON
{
  "sender": "ООО Вектор",
  "amount_rub": 125000,
  "due_date": "2026-08-01"
}
Вопрос 17 из 20
Почему токены исходного и переведённого текста нельзя надёжно сопоставлять по одинаковым индексам?
Python
source_tokens = ["Я", "очень", "скучаю"]
target_tokens = ["I", "miss", "you", "a", "lot"]
Вопрос 18 из 20
У модели есть один фиксированный embedding слова «банк». Какой недостаток проявится в финансовом и географическом корпусах?
Вопрос 19 из 20
Классификатор токсичности обучен на комментариях форума и хорошо работает там, но ошибается в игровых чатах. Какой следующий эксперимент наиболее информативен?
Python
forum_f1 = evaluate(model, forum_test)
game_f1 = evaluate(model, game_test)
Вопрос 20 из 20
Два суммаризатора имеют одинаковую среднюю экспертную оценку. Первый иногда пропускает детали, второй редко, но выдумывает юридические условия. Как выбрать для договоров?

Ответьте на все 20 вопросов, чтобы получить результат

🔗 Встроить тест на свой сайт (iframe) ▼

Скопируйте код и вставьте в любое место на вашем сайте:

Также доступна прямая ссылка на embed-страницу