Научный форум dxdy

Математика, Физика, Computer Science, Machine Learning, LaTeX, Механика и Техника, Химия,
Биология и Медицина, Экономика и Финансовая Математика, Гуманитарные науки




На страницу Пред.  1, 2, 3  След.
 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
MoonWatcher в сообщении #1729478 писал(а):
Если вам дать текст, вы же сможете найти там ответ и дословно привести его?
Если мне зачитать 100кб текста, то сильно не факт, что смогу.
Если дать текст в формате, который позволяет мне переходить между частями туда-сюда (текстовый файл локально, или книга) - то смогу. Ну и любая LLM, у которой есть доступ к командной строке, сможет.
Anton_Peplov в сообщении #1729485 писал(а):
А в чем он в таком случае используется?
В рекламе В публикациях.
На самом деле слегка используются, конечно - при итоговом выборе из нескольких экспериментальных моделей. Но это всё равно в итоге единицы бит информации.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
mihaild в сообщении #1729490 писал(а):
На самом деле слегка используются, конечно - при итоговом выборе из нескольких экспериментальных моделей.
Я представлял себе процесс примерно так. Берем модель, обученную на офигибайтах неразмеченного текста, и обрабатываем ее напильником (дообучение с учителем или что там еще). Результаты обработки напильником проверяем по бенчмарку. Если результаты нас устраивают, то делаем релиз. Если не устраивают, продолжаем обработку напильником и возвращаемся к пункту 1. Если модель допиливают, пока она не научится хорошо проходить бенчмарк, то довольно очевидно, что изменение бенчмарков изменит и результаты релиза. Я представлял себе все неправильно?

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
mihaild в сообщении #1729490 писал(а):
Если дать текст в формате, который позволяет мне переходить между частями туда-сюда (текстовый файл локально, или книга) - то смогу. Ну и любая LLM, у которой есть доступ к командной строке, сможет.

Не вполне понял при чем тут командная строка.

Кстати, свежий материал в тему: Google представил Science One Framework: ИИ для научных исследований без «галлюцинаций»:
Цитата:
Компания Google анонсировала экспериментальный исследовательский прототип Science One Framework*, предназначенный для проведения прозрачных и достоверных научных изысканий с помощью искусственного интеллекта. Главная цель проекта — полностью исключить «галлюцинации» нейросетей.

1. Сбор доказательств («режим детектива») ИИ автономно ищет публикации, датасеты и документацию по теме исследования, анализирует их и отбирает подтверждённые факты.

2. Построение «цепочки доказательств» (Chain of Evidence) Каждый тезис или гипотеза выстраивается в логическую цепочку: Источник A + Данные B \rightarrow Вывод C.

3. Блокировка генерации без источников Если у модели нет прямого подтверждения утверждения в найденных документах, она не включает его в отчёт. Это полностью исключает выдуманные цитаты, факты и несуществующие ссылки.

4. Формирование проверяемого отчёта На выходе исследователь получает структурированный материал, где к каждому предложению или выводу прикреплена точная ссылка на первоисточник (статью, график или конкретную строку данных).

Фреймворк работает по принципу детектива, выстраивая «цепочку доказательств» (chain of evidence). Каждое выдвинутое утверждение ИИ обязан сопоставлять с реальным задокументированным источником. Ожидается, что подборка подтверждённых фактов позволит учёным быть уверенными в точности и надёжности получаемых результатов.

Первоисточник

 Re: Проблема галлюцинаций LLM и пути ее решения
MoonWatcher в сообщении #1729512 писал(а):
Если у модели нет прямого подтверждения утверждения в найденных документах, она не включает его в отчёт. Это полностью исключает выдуманные цитаты, факты и несуществующие ссылки.


Что такое прямое подтверждение? Я нейросеть, и я говорю генерю Текст #1: "В июне сего года Илья Суцкевер анонсировал постройку самого грандиозного в мире сепулькария". Читаем супер-пупер-достоверную статью, Текст #2: "Один и самых влиятельных бывших сотрудников openAI бла-бла-бла занялся возведением дома свой мячты. Бла-бла-бла-100500 букафф. По утверждению Главного Казначея Вселенной, господин Суцкевер планирует закончить свой странноприимный дом для сепулек не позднее 1 июля 2026 года". Как объективно (не через контекстный анализ при помощи LLM, которая глючит) показать, что текст #2 является прямым подтверждением текста #1?

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
ozheredov
Я знаю, что пользоваться подсказками ИИ - дурной тон, но так быстрее и, возможно, надежнее. Вот что ответил ChatGPT (привожу его краткое резюме, которое следует за подробным и развернутым пояснением):
Цитата:
В статье Google DeepMind "ScientistOne" термин "прямое подтверждение" не означает существование объективного алгоритма, который без понимания смысла текста может доказать, что один текст подтверждает другой. Для численных результатов и ссылок система действительно использует детерминированные проверки (например, сверяет числа с логами экспериментов и проверяет существование статей через научные базы данных). Но когда нужно установить, что публикация действительно утверждает то, что ей приписывают, авторы вынуждены использовать семантический анализ (LLM-judged entailment). Более того, в разделе "Limitations" они прямо признают, что полноценная проверка такого рода требует passage-level Natural Language Inference и остается открытой научной проблемой. Следовательно, в вашем примере невозможно объективно, без семантического анализа, доказать, что текст №2 является прямым подтверждением текста №1. Максимум, чего можно добиться алгоритмически, — проверить существование источника, совпадение имен, дат и других формальных атрибутов. Ответ на вопрос, действительно ли смысл второго текста влечет первое утверждение, неизбежно требует понимания естественного языка.

 Re: Проблема галлюцинаций LLM и пути ее решения
MoonWatcher в сообщении #1729515 писал(а):
пользоваться подсказками ИИ - дурной тон

Не, всё по существу, спасибо большое

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
Anton_Peplov в сообщении #1729492 писал(а):
Я представлял себе все неправильно?
Я не помню, что из этого есть в открытых источниках, поэтому могу ответить только заведомо менее детально, чем есть в общедоступной информации :)
Вообще по хорошему нужно сначала выбирать модель на основе каких-то других тестов, а потом публиковать сравнение только для финальной версии. Разумеется многие используют бенчмарки и для выбора версии. Но всё же что-то покрутить и перезапустить обучение с нуля, надеясь что бенчмарк будет пройден лучше - слишком дорого.
Как правило если есть какой-то бенчмарк, под который хотите оптимизироваться, то нужно сделать что-то похожее на этапе обучения. Собственно научить модель говорить "не знаю" можно на этапе RL довольно просто, и это в том или ином виде делается. Элементарно если мы учим модель двум вещам: 1) лучше сказать правду чем что-то кроме правды; 2) лучше сказать правду или "не знаю" чем неправду - то модель уже насколько-то научится говорить "не знаю".
Т.е. на идейном уровне, как и почти всё в LLM, всё просто. Вопрос, как это сделать, чтобы оно правда работало.
MoonWatcher в сообщении #1729512 писал(а):
Не вполне понял при чем тут командная строка
Чтобы можно было смотреть файл по частям. Любые адекватные tools сойдут.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
mihaild
Т.е. LLM обязательно нужен какой-то дополнительный внешний инструмент, чтобы повторно считать текст, найти и запомнить нужные фрагменты (вплоть до всего текста целиком - например, чтобы перевести его)? Это настолько базовый, обязательный уровень работы с информацией, что было бы странно не позаботиться об этой проблеме - хотя бы и посредством задействования дополнительных инструментов. Однако в бесплатных моделях (платными не пользовался) это либо вообще не работает, либо работает через пень колоду.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
MoonWatcher в сообщении #1729549 писал(а):
Т.е. LLM обязательно нужен какой-то дополнительный внешний инструмент, чтобы повторно считать текст, найти и запомнить нужные фрагменты
Человеку тоже.
А Вы хотя бы на базовом уровне архитектуру LLM представляете?
MoonWatcher в сообщении #1729549 писал(а):
Это настолько базовый, обязательный уровень работы с информацией, что было бы странно не позаботиться об этой проблеме - хотя бы и посредством задействования дополнительных инструментов. Однако в бесплатных моделях
было бы странно выделять ресурсы, превосходящие одного стажера, на решение каких бы то ни было проблем.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
mihaild в сообщении #1729551 писал(а):
Человеку тоже.
А Вы хотя бы на базовом уровне архитектуру LLM представляете?

На очень сильно базовом - что они предсказывают следующий токен на основе статических закономерностей обучающего датасета. Поэтому мне непонятна грань, за которой точное оперирование текстом (когда я прошу модель перевести одну страницу) переходит в неточную статистику (когда я прошу перевести десять страниц).

mihaild в сообщении #1729551 писал(а):
было бы странно выделять ресурсы, превосходящие одного стажера, на решение каких бы то ни было проблем.

Не понял.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
MoonWatcher в сообщении #1729553 писал(а):
На очень сильно базовом - что они предсказывают следующий токен на основе статических закономерностей обучающего датасета
Это даже не архитектура, это просто определение языковой модели.
Вот первая попавшаяся статья на тему https://www.0xkato.xyz/how-llms-actually-work/
MoonWatcher в сообщении #1729553 писал(а):
Поэтому мне непонятна грань, за которой точное оперирование текстом (когда я прошу модель перевести одну страницу) переходит в неточную статистику (когда я прошу перевести десять страниц).
Во-первых, у модели есть контекстное окно, у топовых современных - 1-2 миллиона токенов, токен это примерно $3/4$ английского или $1/2$ русского слова. Модель в принципе не может видеть больше текста.
Во-вторых, на практике в пределах этого окна модель хорошо "помнит" последние 10-20 тысяч токенов, а влияние предыдущих ослабевает. См. всевозможные needle in hastack бенчмарки.
MoonWatcher в сообщении #1729553 писал(а):
Не понял.
Разработка моделей стоит денег.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
mihaild в сообщении #1729556 писал(а):
Во-первых, у модели есть контекстное окно, у топовых современных - 1-2 миллиона токенов, токен это примерно $3/4$ английского или $1/2$ русского слова. Модель в принципе не может видеть больше текста.
Во-вторых, на практике в пределах этого окна модель хорошо "помнит" последние 10-20 тысяч токенов, а влияние предыдущих ослабевает. См. всевозможные needle in hastack бенчмарки.

В том-то и дело, что модель сыпется и галлюцинирует (например, придумывает несуществующие цитаты) в том числе и в относительно небольших файлах, чей размер заведомо меньше заявленного контекстного окна. Например, в моем последнем случае в тексте всего 11 тыс символов (чуть больше 2 тыс слов).

Про needle in hastack я в курсе и даже хотел упомянуть - но успешное прохождение этих тестов даже на миллионом контексте вроде бы не гарантирует точности. Т.е. модель может ответить верно по существу, но исказить дословную цитату. И вообще в последний год я этих тестов не встречаю (в системной карте Opus 5 слово needle даже не упоминается), поэтому мне трудно оценить размер текста, который должны помнить современные модели.

mihaild в сообщении #1729556 писал(а):
Разработка моделей стоит денег.

Если вы хотите сказать, что никто не будет решать проблемы в бесплатных моделях, то во-первых это спорно, а во-вторых не уверен, что в платных моделях такой проблемы не существует.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
MoonWatcher
Если Вы не работали с платными ChatGPT или Claude (а уж тем более, если бесплатная модель, о которой идёт речь - это какой-нибудь DeepSeek или Qwen, не говоря об алисе или гигачате) - то Вы не можете судить об уровне галлюцинаций.
Хорошие модели сегодня - это только платные ChatGPT и Claude (возможно, ещё Gemini, но про неё не знаю - у ChatGPT меня в своё время впечатлила даже бесплатная версия, хотя она явно хуже платной, а у Gemini бесплатный вариант откровенно разочаровал).

Мой опыт говорит о том, что галлюцинаций нет. Я вижу, что у кого-то другой опыт, но у меня такой. В том числе при работе с текстами.

Что касается уровня галлюцинаций под 50-80% в бенчмарке - это вообще ни о чём.
Если я правильно понял, это без доступа к интернету и написанию кода.
Модель без интернета и кода - это вообще не интеллект. Это как если человека лишить глаз и рук. Он что-то помнит, но никак не может проверить себя, и все рассуждения может вести только "в уме". Но ведь интеллект - это не набор точных знаний, а умение работать с ними.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
Mikhail_K в сообщении #1729595 писал(а):
Модель без интернета и кода - это вообще не интеллект.

Хм... интересно. Я до сегодняшнего дня думал, что в топовые модели загружено вообще всё, написанное человечеством, включая все тексты Интернета. И могут быть проблемы только с новостями, появившимися позже.

 Re: Проблема галлюцинаций LLM и пути ее решения
Аватара пользователя
worm2 в сообщении #1729597 писал(а):
Хм... интересно. Я до сегодняшнего дня думал, что в топовые модели загружено вообще всё, написанное человечеством, включая все тексты Интернета. И могут быть проблемы только с новостями, появившимися позже.
Загружено-то всё, но модель просто по объёму гораздо меньше загруженного в неё материала. Модель - это вам не чудо-архиватор. Она не может чётко помнить всё, что в неё загрузили.
Как и человек не помнит всю информацию, которую он когда-либо читал, видел или слышал. Но это и не нужно, если у него есть к информации доступ и при этом есть знания, чтобы её понимать сходу.

 [ Сообщений: 35 ]  На страницу Пред.  1, 2, 3  След.


Соглашение о конфиденциальности | Общие правила

Powered by phpBB © 2000, 2002, 2005, 2007 phpBB Group