🤖 ИИ  ·  20 вопросов  ·  ~45 мин  ·  ⏱ Таймер 45:00  ·  Средний  · 

Галлюцинации и надёжность ответа

Убедительная формулировка не превращает предположение в факт. Языковая модель может выдумать источник, смешать версии, неверно продолжить число или ответить за пределами доступных данных. Тест учит распознавать признаки выдумки, проверять утверждения и выбирать допустимый уровень автоматизации.

Отвечено: 0 из 20
⏱ --:--
0%
💡 Инструкция: Выбери один ответ из четырёх. В тесте 20 вопросов и 45 минут; не меньше половины заданий требуют прочитать код, конфигурацию или формализованную схему. После завершения откроются общий процент, четыре тематические шкалы, правильные ответы и разбор каждого решения.
Вопрос 1 из 20
Модель попросили назвать внутренний номер договора, которого нет в контексте и открытых источниках. Почему она может выдать правдоподобный номер?
Python
context = "Договор заключён с ООО Вектор."
question = "Назови внутренний номер договора"
Вопрос 2 из 20
Какой признак сильнее всего указывает на возможную выдумку источника?
Python
citation = {'title': 'Neural Memory in Sparse Agents',
 'doi': '10.5555/nmsa.2024.17'}
registry_lookup(citation["doi"])
Вопрос 3 из 20
Модель вычисляет 17×28 как 486. Как проверять такой ответ?
Python
verified = 17 * 28
assert verified == 476
Вопрос 4 из 20
Можно ли автоматически публиковать придуманные варианты названия статьи без проверки фактов?
Вопрос 5 из 20
Почему низкая температура не устраняет галлюцинации?
Python
prompt = build_prompt(context, question)
answer_1 = model.generate(prompt, temperature=0)
answer_2 = model.generate(prompt, temperature=0)
assert answer_1 == answer_2
Вопрос 6 из 20
Ответ называет закон, но в следующем абзаце меняет номер статьи. Что это за сигнал?
Текстtext
Абзац 1: право возникает на основании статьи 12.
Абзац 3: это право регулирует статья 21.
Вопрос 7 из 20
Как проверить цитату из документа, переданного в RAG?
Python
source = sources[claim.source_id]
assert normalize(claim.quote) in normalize(source.text)
Вопрос 8 из 20
Система советует лекарственную дозировку по фотографии упаковки. Какой режим доверия уместен?
Вопрос 9 из 20
Модель уверенно рассказывает биографию несуществующего учёного. Какой тест выявляет этот класс ошибок?
Python
test_cases = [{'person': 'Алексей Воронцов-Кельнский',
  'exists': False}]
Вопрос 10 из 20
Два источника дают разные текущие тарифы. Что делать?
Вопрос 11 из 20
Какой ответ надёжнее при отсутствии сведений?
Вопрос 12 из 20
Почему самопроверка той же моделью ограниченна?
Вопрос 13 из 20
Как проверить, что указанная статистика относится к нужному году и стране?
Python
claim = {'value': 12.4,
 'unit': '%',
 'country': 'EE',
 'year': 2025}
verify_against_dataset(claim, source_table)
Вопрос 14 из 20
Автоматический ответ на заявление о мошенничестве предлагает заблокировать счёт. Что нужно до действия?
Вопрос 15 из 20
Ответ приводит число с точностью до 0,001, хотя исходные данные округлены до целых. Что это может означать?
Вопрос 16 из 20
Какой код лучше отделяет генерацию формулировки от вычисления суммы?
Python
total = sum(invoice.amounts)
text = model.generate({"verified_total": total, "task":"объясни расчёт"})
Вопрос 17 из 20
Модель дала ссылку на страницу, которая существует, но не подтверждает утверждение. Как классифицировать?
Вопрос 18 из 20
Когда ответ можно использовать как черновик без проверки каждого предложения?
Вопрос 19 из 20
Какой мониторинг нужен после выпуска помощника по базе знаний?
Python
metrics = ['unsupported_claim_rate',
 'bad_citation_rate',
 'abstention_rate',
 'user_correction_rate',
 'critical_incidents']
Вопрос 20 из 20
Какой принцип лучше всего задаёт границу доверия?

Ответьте на все 20 вопросов, чтобы получить результат

🔗 Встроить тест на свой сайт (iframe) ▼

Скопируйте код и вставьте в любое место на вашем сайте:

Также доступна прямая ссылка на embed-страницу