Научный форум dxdy

Математика, Физика, Computer Science, Machine Learning, LaTeX, Механика и Техника, Химия,
Биология и Медицина, Экономика и Финансовая Математика, Гуманитарные науки




На страницу 1, 2, 3  След.
 Проблема галлюцинаций LLM и пути ее решения
 i  Ende
Выделено из темы «Снова об образовании в эпоху ИИ»


Mikhail_K в сообщении #1729424 писал(а):
Хорошие не галлюцинируют уже сейчас
Мммммм… Нет. Хорошие нейросети научились не галлюцинировать на "ходовых" темах. Неважно, какова их сложность с человеческой точки зрения, главное, чтобы по этой теме было написано много текстов. Мне за последние пару месяцев пришлось столкнуться относительно простыми задачами, но в рамках относительно редких технологий. Галлюцинируют, собаки. Надо попробовать как-нибудь протестировать, может, на выходных займусь.

 Re: Снова об образовании в эпоху ИИ
Аватара пользователя
Уровень галлюцинаций в бенчмарке AA-Omniscience у лучших на сегодня моделей:
Claude Opus 5 - 50%
Claude Fable 5 - 55%
GPT‑5.6 Sol - 89%.

 Re: Снова об образовании в эпоху ИИ
Аватара пользователя
MoonWatcher в сообщении #1729442 писал(а):
Уровень галлюцинаций в бенчмарке AA-Omniscience у лучших на сегодня моделей:
Claude Opus 5 - 50%
Claude Fable 5 - 55%
GPT‑5.6 Sol - 89%.
Если я правильно понял, это при отключённом интернете и в условиях, когда модель и не может дать верный ответ из-за объективной нехватки знаний. То есть тестируется способность признавать незнание.
Допускаю, что так.
Конечно, это задача для разработчиков моделей, чтобы этот показатель снижался.
Но если интернет у вас включён, и ваш вопрос не касается чего-то такого, о чём вообще нельзя узнать или логически вывести из всех текстов мира, то эти цифры вряд ли чего-то значат.

На самом деле, я даже не уверен, что высокий процент галлюцинаций тут - это плохо.
Если вопрос касается чего-то действительно неизвестного, то лучше дать какой-то ответ, чем не дать никакого.
Отказ от ответа бесполезен для пользователя. А неверный ответ пользователь простит, если понимает сложность вопроса.
Но там, где не работают знания и логика, вдруг сработает эвристика.

 Re: Снова об образовании в эпоху ИИ
Аватара пользователя
Mikhail_K в сообщении #1729443 писал(а):
Если я правильно понял, это при отключённом интернете и в условиях, когда модель и не может дать верный ответ из-за объективной нехватки знаний. То есть тестируется способность признавать незнание.

Да, именно так.

Mikhail_K в сообщении #1729443 писал(а):
Но если интернет у вас включён, и ваш вопрос не касается чего-то такого, о чём вообще нельзя узнать или логически вывести из всех текстов мира, то эти цифры вряд ли чего-то значат.

По моему личному опыту работы с бесплатными моделями они также постоянно галлюцинируют при работе с текстами. Например, даешь им копи-паст текста YouTube видео, просишь отредактировать и перевести - в лучшем случае обрежут, в худшем - переврут. И что хуже всего - никогда об этом заранее не предупредят.

Mikhail_K в сообщении #1729443 писал(а):
На самом деле, я даже не уверен, что высокий процент галлюцинаций тут - это плохо.
Если вопрос касается чего-то действительно неизвестного, то лучше дать какой-то ответ, чем не дать никакого.
Там, где не работают знания и логика, вдруг сработает эвристика.

Хорошо бы научить отличать одно от другого. Если я спрашиваю про школьное прозвище Мишель Обамы, то модель должна сказать "Не знаю". А если прошу решить открытую научную проблему, то возможно без галлюцинаций действительно никуда. Но даже в этом случае галлюцинации должны быть осмысленными - модель должна отдавать себе отчет в том, что она рассуждает нестандартно или даже противоречит общепринятым сведениям. Проблема нынешнего ИИ на базе LLM в том, что он не отдает себе в этом отчет.

Может я и преувеличиваю проблему, но ИМХО пока не решат проблему галлюцинаций, то ни о каком AGI не может быть и речи. И если прогресс в когнитивных способностях ИИ огромный, то в плане галлюцинаций, вопреки ожиданиям руководителей ИИ-компаний, дела обстоят по-прежнему плачевно.

 Re: Снова об образовании в эпоху ИИ
Аватара пользователя
Проблема галлюцинаций действительно стоит остро. Одно из возможных решений описано здесь: сменить схему работы с бенчмарками. Сейчас в большинстве бенчмарков за прямую ложь и ответ "не знаю" присуждается один и тот же ноль баллов. Поэтому стратегия максимизации баллов - в случае незнания ляпнуть хоть что-нибудь, авось угадаешь. Хорошо известная школьникам и студентам стратегия. Авторы предлагают за ответ "не знаю" присуждать ноль, а за неправильный ответ - штрафовать. Тогда модель будет отвечать, лишь когда "уверена" в ответе (метрика этой уверенности - отдельный, но разрешимый вопрос).

 Re: Снова об образовании в эпоху ИИ
Аватара пользователя
Anton_Peplov в сообщении #1729454 писал(а):
Проблема галлюцинаций действительно стоит остро. Одно из возможных решений описано здесь
: сменить схему работы с бенчмарками. Сейчас в большинстве бенчмарков за прямую ложь и ответ "не знаю" присуждается один и тот же ноль баллов. Поэтому стратегия максимизации баллов - в случае незнания ляпнуть хоть что-нибудь, авось угадаешь. Хорошо известная школьникам и студентам стратегия. Авторы предлагают за ответ "не знаю" присуждать ноль, а за неправильный ответ - штрафовать. Тогда модель будет отвечать, лишь когда "уверена" в ответе (метрика этой уверенности - отдельный, но разрешимый вопрос).

Если бы все было так просто - давно бы сделали, ИМХО. Мы можем регулировать температуру и ее настройками сделать так, что модель никогда не будет отвечать положительно, не будучи уверенной в ответе - но в этом случае будут отсечены и потенциально правильные ответы, модель резко поглупеет.

 Re: Снова об образовании в эпоху ИИ
Аватара пользователя
MoonWatcher в сообщении #1729464 писал(а):
Если бы все было так просто - давно бы сделали, ИМХО.
Препринт прошлогодний. Трое из четырех авторов работают в OpenAI. Если бы предложенный вариант уже пробовали и "не взлетело", они бы, наверное, об этом знали. Тут лучше спросить у mihaild, но я склоняюсь к мысли, что до недавнего времени разработчики клали низкий приоритет на проблему правдоподобных, но неверных ответов. Поскольку главной задачей было превратить модель в собеседника, мало отличимого от человека. Сейчас эта задача решена, так что можно заняться и проблемой правдоподобных галлюцинаций. Что получится - время покажет. Гадать бессмысленно. Даже разработчики далеко не всегда понимают, почему одно срабатывает, а другое нет.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
Anton_Peplov
Я просто хорошо помню, как два-три года назад Сэм Альтман и куда более правдивый Илья Суцкевер выражали уверенность, что проблема галлюцинаций будет решена в ближайшие полтора-два года. А последнее, что я слышал от Альтмана на эту тему - "это не баг, а фича"...

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
MoonWatcher
Я не утверждаю, что предложенный в препринте вариант радикально решит проблему. Я констатирую: такой вариант, почти очевидный даже сугубому дилетанту вроде меня, компетентные люди в 2025 году посчитали достаточно новым для препринта. Исходя из этого я предполагаю, что за проблему толком еще и не брались. Что бы там говорящие головы ни обещали инвесторам.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
Anton_Peplov
Мне встречались разные подходы к решению этой проблемы (например), очевидность какого-то из них не означает, что за проблему толком не брались. Эта проблема остро стояла с самого начала появления LLM и ставила крест на их полноценном использовании. Абсолютному большинству пользователей (через которых и можно монетизировать ИИ) нужен не рассеянный гений, а точный и надежный помощник или работник. Все эти "говорящие головы" еще несколько лет назад расписывали дорожную карту с AGI и ASI, и судя по успехам в этом направлении, это не был просто маркетинг. Если так, то и проблему галлюцинаций планировали решить еще давно. В том-то и беда - это похоже фундаментальное, неотделимое от интеллекта, свойство LLM.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
Anton_Peplov в сообщении #1729454 писал(а):
Проблема галлюцинаций действительно стоит остро. Одно из возможных решений описано здесь: сменить схему работы с бенчмарками.
Довольно очевидно, что изменение бенчмарка непосредственно ничего не решит, потому что бенчмарк в генерации весов никак не используется.
Замечание про то, что большинство популярных бенчмарков не поощряют говорить "не знаю", и предложение что-то тут поменять, чтобы мотивировать разработчиков уменьшать галлюцинации. 15 конкурирующих стандартов бенчмарков.xkcd.
Сама по себе идея, что можно добавить вариант "не знаю", очень сильно не новая. Я её слышал на курсе вроде бы в 2011 году, и не думаю что её тогда только придумали.

Проблема "модель несет бред и даже этого не понимает" есть, усилия по её решению предпринимаются, некоторые успехи есть, но до полного решения еще далеко.
MoonWatcher в сообщении #1729475 писал(а):
В том-то и беда - это похоже фундаментальное, неотделимое от интеллекта, свойство LLM
Это и свойство человека. Вот лично я как раз сейчас почему-то решил, что в скрипичном ключе фа диез должен стоять при первой октаве, а не при второй. Перепроверил, спросил у умных людей - говорят, что всегда был при второй. Но у меня всё ещё стойкое ощущение, что был на первой.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
mihaild
Лично меня больше всего бесят галлюцинации при работе с текстами. Если вам дать текст, вы же сможете найти там ответ и дословно привести его? Бесплатные LLM не могут.

 Re: Проблема галлюцинаций LLM и пути ее решения
MoonWatcher в сообщении #1729470 писал(а):
Сэм Альтман и куда более правдивый Илья Суцкевер


В какой метрике более правдивый? Я без рофла: по числу сбывшихся/несбывшихся прогнозов, по озвучанию фактов, которые впоследствии оказались враньём (система распознавания вранья сама может лажать), или как-то ещё? И кстати, правдивость Суцкевера это Ваше личное впечатление или так написали в ТГ?

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя

(Оффтоп)

ozheredov
Я считаю (опираясь на информацию о знаменитом расколе в OpenAI), что Суцкевер - бессребреник, в отличие от Альтмана. И соответственно его заявления не были обусловлены маркетинговыми соображениями. Собственно я и Альтмана считаю вполне правдивым в его прогнозах - как и Илона Маска, знаменитого своими провальными обещаниями. Но если Маск возможно делал это намеренно, чтобы подстегнуть свою команду ("Я уже обещал - не подведите!"), то Суцкевер говорил то, что думает, ИМХО.

Обещания, которые не сбываются, вредят репутации куда больше каких-то сиюминутных маркетинговых соображений. Да и какие могут быть соображения для заведомо ложных обещаний? Я говорил и настаиваю - надо быть идиотом, чтобы не вкладывать в ИИ огромные инвестиции. Если многие ученые в этой области допускают возможность создания AGI уже в ближайшие годы хотя бы с 50% вероятностью, то было бы непростительной глупостью не рискнуть хотя бы частью своих капиталов. Поэтому в интересах того же Альтмана не обещать ничего такого, во что он сам не верит. Ну кроме расплывчатых заявлений о том, что AGI не заменит человека в работе, а дополнит его - это откровенное лукавство. В этом отношении убедительнее Маск, обещающий ББД.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
mihaild в сообщении #1729477 писал(а):
Довольно очевидно, что изменение бенчмарка непосредственно ничего не решит, потому что бенчмарк в генерации весов никак не используется.
Не понял. А в чем он в таком случае используется?

 [ Сообщений: 35 ]  На страницу 1, 2, 3  След.


Соглашение о конфиденциальности | Общие правила

Powered by phpBB © 2000, 2002, 2005, 2007 phpBB Group