🤖 ИИ  ·  20 вопросов  ·  ~45 мин  ·  ⏱ Таймер 45:00  ·  Средний  · 

Мультимодальные модели

Мультимодальная система связывает текст, изображения, звук или видео, но каждый канал имеет собственные ошибки и стоимость. Тест проверяет подготовку разных типов данных, выравнивание представлений, выбор практического конвейера и ограничения, которые нельзя увидеть по одному красивому примеру.

Отвечено: 0 из 20
⏱ --:--
0%
💡 Инструкция: Выбери один ответ из четырёх. В тесте 20 вопросов и 45 минут; не меньше половины заданий требуют прочитать код, конфигурацию или формализованную схему. После завершения откроются общий процент, четыре тематические шкалы, правильные ответы и разбор каждого решения.
Вопрос 1 из 20
Видео длительностью 10 минут анализируют по одному кадру в секунду. Сколько кадров поступит в модель?
Python
duration_minutes = 10
fps_sampled = 1
frames = duration_minutes * 60 * fps_sampled
Вопрос 2 из 20
Почему подпись «собака бежит» к фотографии спящего кота особенно вредна в парном обучении?
Python
image_vec = image_encoder(image_of_sleeping_cat)
text_vec = text_encoder("собака бежит")
positive_pair_score = cosine_similarity(image_vec, text_vec)
loss = -log_softmax(positive_pair_score)
Вопрос 3 из 20
Нужно искать товар по фотографии и тексту «такой же, но красный». Какой подход естественнее?
Вопрос 4 из 20
Модель уверенно отвечает по размытому снимку серийного номера. Что должна делать система?
Python
if blur_score(image) > threshold or ocr_confidence < .8:
    return request_better_photo()
Вопрос 5 из 20
Аудио подано с частотой 48 кГц, а модель ожидает 16 кГц. Что нужно сделать?
Python
orig_sr = 48_000
target_sr = 16_000
audio_16k = resample(audio_48k, orig_sr, target_sr)
assert sample_rate(audio_16k) == target_sr
Вопрос 6 из 20
В записи встречи транскрипт отстаёт от видео на 4 секунды. Какой этап нарушен?
Python
aligned_text_time = transcript_time - 4.0
frame = video.frame_at(aligned_text_time)
Вопрос 7 из 20
Система читает счёт: OCR извлёк сумму 18 000, а визуальная модель видит 13 000. Что делать?
Вопрос 8 из 20
Фотография имеет форму `(3, 224, 224)`. Что обычно обозначает первая ось?
Python
image_tensor = preprocess(photo)
assert image_tensor.shape == (3, 224, 224)
batch = image_tensor.unsqueeze(0)
logits = vision_model(batch)
Вопрос 9 из 20
Для анализа длинного видео модель получает только первые 16 кадров. Какой риск?
Python
total_frames = len(frames)
selected = frames[:16]
event_frame = frames[total_frames // 2]
was_event_seen = event_frame in selected
Вопрос 10 из 20
Как проверить пользу изображения в задаче классификации объявления?
Вопрос 11 из 20
Почему OCR-текст следует хранить вместе с координатами блоков?
JSON
block = {'text': 'Итого 12 500',
 'bbox': [840, 1260, 1120, 1310],
 'page': 2}
Вопрос 12 из 20
Что делает контрастивное обучение изображение–текст в упрощённом виде?
Python
image_embeddings = normalize(image_encoder(images))
text_embeddings = normalize(text_encoder(captions))
similarity = image_embeddings @ text_embeddings.T
loss = contrastive_loss(similarity, positive_diagonal=True)
Вопрос 13 из 20
У пользователя нет аудиодорожки, но система ожидает её всегда. Как проектировать?
Вопрос 14 из 20
При сканировании паспорта модель передаёт изображение стороннему сервису без уведомления. Какой риск?
Вопрос 15 из 20
Как объединить текстовое и визуальное представления при простом позднем объединении?
Python
p_text = text_model(text)
p_image = image_model(image)
p_final = meta_model(concat(p_text, p_image))
Вопрос 16 из 20
Вопрос к графику: «Какое значение было в марте?» Почему одного OCR может быть недостаточно?
Вопрос 17 из 20
Из видео нужно найти короткий момент падения предмета. Какой способ эффективнее равномерного одного кадра в минуту?
Python
motion_scores = estimate_motion(frames)
segments = select_peaks(motion_scores, window_seconds=3)
Вопрос 18 из 20
Модель описывает фото уверенно, но не видит мелкий предупреждающий знак. Какой вывод?
Вопрос 19 из 20
Какой тест лучше проверяет синхронизацию мультимодальной встречи?
Вопрос 20 из 20
Какой журнал нужен для расследования ошибки мультимодальной системы?
Python
trace = {"inputs":hashes,"frames":frame_times,"asr":segments,"ocr":blocks,"quality":quality_scores,"answer":answer}

Ответьте на все 20 вопросов, чтобы получить результат

🔗 Встроить тест на свой сайт (iframe) ▼

Скопируйте код и вставьте в любое место на вашем сайте:

Также доступна прямая ссылка на embed-страницу