🤖 ИИ  ·  20 вопросов  ·  ~45 мин  ·  ⏱ Таймер 45:00  ·  Сложный  · 

Глубокое обучение и архитектуры сетей

Архитектура задаёт не престиж модели, а способ использовать структуру данных. Свёртки хорошо извлекают локальные закономерности изображения, рекуррентные сети передают состояние по последовательности, а трансформеры связывают позиции через внимание. Тест требует читать формы тензоров и выбирать архитектуру под ограничения, а не по моде.

Отвечено: 0 из 20
⏱ --:--
0%
💡 Инструкция: Выбери один ответ из четырёх. В тесте 20 вопросов и 45 минут; не меньше половины заданий требуют прочитать код, конфигурацию или формализованную схему. После завершения откроются общий процент, четыре тематические шкалы, правильные ответы и разбор каждого решения.
Вопрос 1 из 20
Почему свёртка полезна для изображений?
Вопрос 2 из 20
Какова форма выхода Conv2d(3, 16, kernel_size=3, padding=1) для пакета (8, 3, 64, 64)?
Python
layer = nn.Conv2d(3, 16, kernel_size=3, padding=1)
x = torch.randn(8, 3, 64, 64)
y = layer(x)
Вопрос 3 из 20
Зачем трансформеру позиционные представления или другой механизм порядка?
Вопрос 4 из 20
Для классификации коротких табличных данных из 20 числовых признаков выбирают исходную модель. Какой вариант разумнее поставить базовым?
PythonУсловия задачи
X.shape == (12000, 20)
y.shape == (12000,)
latency_limit_ms = 5
training_budget = "one_gpu_hour"
Вопрос 5 из 20
Как влияет stride=2 в этой свёртке?
Python
down = nn.Conv2d(32, 64, kernel_size=3, stride=2, padding=1)
Вопрос 6 из 20
Что хранит hidden state простой RNN?
Вопрос 7 из 20
Что делает causal mask в decoder self-attention?
Python
mask = torch.triu(torch.ones(T, T), diagonal=1).bool()
scores = scores.masked_fill(mask, float("-inf"))
Вопрос 8 из 20
Модель должна отвечать на устройстве за 20 мс без сети. Как это влияет на выбор?
Вопрос 9 из 20
Чему пропорциональна память матрицы полного self-attention по длине T?
\text{memory}=O(T^2)
Python
scores = Q @ K.transpose(-1, -2)
Вопрос 10 из 20
Почему одна RNN может хуже обрабатывать очень длинные зависимости?
Вопрос 11 из 20
Как увеличивается receptive field при стеке свёрток 3×3 со stride 1?
Python
x = conv3x3_1(image)
x = relu(x)
x = conv3x3_2(x)
x = relu(x)
x = conv3x3_3(x)
Вопрос 12 из 20
Как обработать пакет последовательностей разной длины без влияния padding на результат?
Python
attention_mask = (token_ids != PAD_ID)
out = model(token_ids, attention_mask=attention_mask)
Вопрос 13 из 20
Что вычисляет одна голова self-attention?
A=\operatorname{softmax}(QK^T/\sqrt{d_k})
Python
A = softmax((Q @ K.T) / sqrt(d_k), axis=-1)
Y = A @ V
Вопрос 14 из 20
У компании 800 размеченных снимков. Как разумно начать?
Вопрос 15 из 20
Чем max pooling отличается от обучаемой свёртки?
Python
x = torch.randn(8, 32, 64, 64)
pool = nn.MaxPool2d(kernel_size=2, stride=2)
y = pool(x)
print(x.shape, y.shape)
Вопрос 16 из 20
Почему bidirectional RNN нельзя напрямую использовать для потокового предсказания текущего токена без задержки?
Вопрос 17 из 20
В encoder-only трансформере обычно разрешено двунаправленное внимание. Для какой задачи это естественно?
Вопрос 18 из 20
Две модели имеют одинаковое качество, но одна потребляет в четыре раза больше памяти. Что предпочтительнее при прочих равных?
Вопрос 19 из 20
Зачем в CNN увеличивают число каналов на более глубоких уровнях?
Python
features = nn.Sequential(
  nn.Conv2d(3, 32, 3, padding=1),
  nn.MaxPool2d(2),
  nn.Conv2d(32, 64, 3, padding=1),
  nn.MaxPool2d(2)
)
Вопрос 20 из 20
Какой подход лучше для документа длиной 200 тысяч токенов при ограниченной памяти?

Ответьте на все 20 вопросов, чтобы получить результат

🔗 Встроить тест на свой сайт (iframe) ▼

Скопируйте код и вставьте в любое место на вашем сайте:

Также доступна прямая ссылка на embed-страницу