Если Вы не работали с платными ChatGPT или Claude (а уж тем более, если бесплатная модель, о которой идёт речь - это какой-нибудь DeepSeek или Qwen, не говоря об алисе или гигачате) - то Вы не можете судить об уровне галлюцинаций.
Хорошие модели сегодня - это только платные ChatGPT и Claude (возможно, ещё Gemini, но про неё не знаю - у ChatGPT меня в своё время впечатлила даже бесплатная версия, хотя она явно хуже платной, а у Gemini бесплатный вариант откровенно разочаровал).
Мой опыт говорит о том, что галлюцинаций нет. Я вижу, что у кого-то другой опыт, но у меня такой. В том числе при работе с текстами.
Рад это слышать, но боюсь ваш опыт не вполне типичен.
Что касается уровня галлюцинаций под 50-80% в бенчмарке - это вообще ни о чём.
Если я правильно понял, это без доступа к интернету и написанию кода.
Модель без интернета и кода - это вообще не интеллект. Это как если человека лишить глаз и рук. Он что-то помнит, но никак не может проверить себя, и все рассуждения может вести только "в уме". Но ведь интеллект - это не набор точных знаний, а умение работать с ними.
Разница в том, что человек как правило понимает, что он чего-то не знает. Конечно, бывают ложные воспоминания и тому подобное, но подозреваю, что люди в этих бенчмарках покажут гораздо более лучшие результаты.
Да и с Интернетом не так все однозначно - когда несколько месяцев назад я попросил знакомого поручить модели небольшое исследование через поиск в Интернете, то результаты были хуже моих собственных. Впрочем, возможно с тех пор что-то поменялось.