Если я правильно понял, это при отключённом интернете и в условиях, когда модель и не может дать верный ответ из-за объективной нехватки знаний. То есть тестируется способность признавать незнание.
Да, именно так.
Но если интернет у вас включён, и ваш вопрос не касается чего-то такого, о чём вообще нельзя узнать или логически вывести из всех текстов мира, то эти цифры вряд ли чего-то значат.
По моему личному опыту работы с
бесплатными моделями они также постоянно галлюцинируют при работе с текстами. Например, даешь им копи-паст текста YouTube видео, просишь отредактировать и перевести - в лучшем случае обрежут, в худшем - переврут. И что хуже всего - никогда об этом заранее не предупредят.
На самом деле, я даже не уверен, что высокий процент галлюцинаций тут - это плохо.
Если вопрос касается чего-то действительно неизвестного, то лучше дать какой-то ответ, чем не дать никакого.
Там, где не работают знания и логика, вдруг сработает эвристика.
Хорошо бы научить отличать одно от другого. Если я спрашиваю про школьное прозвище Мишель Обамы, то модель должна сказать "Не знаю". А если прошу решить открытую научную проблему, то возможно без галлюцинаций действительно никуда. Но даже в этом случае галлюцинации должны быть осмысленными - модель должна отдавать себе отчет в том, что она рассуждает нестандартно или даже противоречит общепринятым сведениям. Проблема нынешнего ИИ на базе LLM в том, что он не отдает себе в этом отчет.
Может я и преувеличиваю проблему, но ИМХО пока не решат проблему галлюцинаций, то ни о каком AGI не может быть и речи. И если прогресс в когнитивных способностях ИИ огромный, то в плане галлюцинаций, вопреки ожиданиям руководителей ИИ-компаний, дела обстоят по-прежнему плачевно.