Научный форум dxdy

Математика, Физика, Computer Science, Machine Learning, LaTeX, Механика и Техника, Химия,
Биология и Медицина, Экономика и Финансовая Математика, Гуманитарные науки




На страницу Пред.  1 ... 4, 5, 6, 7, 8
 Re: Будущие перспективы ИИ (возможно, 4-я волна ИИ)
Аватара пользователя
Mihaylo в сообщении #1723254 писал(а):
Ведущие западные модели погаллюцинировали годик, а потом перестали
Рейтинг галлюцинаций в бенчмарке AA-Omniscience Hallucination Rate (неверный ответ в тех случаях, когда модели следовало признать, что она не знает ответа) у GPT-5.5 (считается лучшей в мире на сегодня моделью, среди публично доступных) - 86%.

Mihaylo в сообщении #1723254 писал(а):
Китайские продолжают галлюцинировать, хотя Дипсик V4, который выпустили буквально позапозавчера, удивил...
94%.

Rasool в сообщении #1723252 писал(а):
Современным сторонникам LLM, которые "крыльями не машут", я скажу: "Как вы собираетесь бороться с галлюцинациями современных LLM? С помощью RAG? Так пока вроде бы не очень хорошо получается".
Из последнего, что я слышал - с помощью RLCR, Reinforcement Learning with Calibration Rewards. Хотя лично я настроен скептически - решение этой безусловно самой главной проблемы ИИ, которая ставит крест на AGI, нам уверенно обещают уже несколько лет - а воз и ныне там.

 Re: Будущие перспективы ИИ (возможно, 4-я волна ИИ)
На мой взгляд, чтобы перестать галлюцинировать, нужно классифицировать универсум знаний - фундаментальное (словари, энциклопедии), академическое (учебники, статьи), научно-популярное, пропагандистское, чтиво и т.п. В свою очередь, есть ещё классификация - современное, устаревшее, псевдонаучное.
Второй момент - более тщательное преследование цели пользователя из серии промтов. Если промт неконкретен или подозрительно ошибочен, то надо не стесняться задавать наводящие/встречные вопросы. Вместо заполнения инфовакуума фантазиями. Нужно выявлять неопределённости, обозначать их и выносить на обсуждение.
Третий момент - работа с тезаурусом пользователя, это сильно переплетается со вторым пунктом. Нужно понимать, где пользователь разбирается, а где нет. Соответственно, там, где разбирается, пусть пользователь уточнит. А там, где слаб, включить режим фантазирования/предположений или режим разъяснений/обучения.

Пока не научатся LLM применять формулу Шеннона для оценки и оптимизации всех этих вещей, они будут на каждый новый промпт генерировать что-то новое в отрыве от уже занесённого в голову пользователя (игнорировать тезаурус пользователя) и будут продолжать фантазировать.

-- 27.04.2026, 21:41 --

Диалог в режиме "Один промпт - один ответ" - это вырожденный диалог, тривиальный. Имеет место, когда промпт хорошо сформулирован, цель и тезаурус пользователя прочитались удачно. Но, как правило, это не работает. И уже из первого промпта можно увидеть, что диалог требует нескольких циклов общения. Вместо этого, LLM пытаются как можно быстрее тривиализировать диалог - сделать развёрнутый завершающий ответ, который приходится нередко мимо цели и тезауруса пользователя.

Пример тривиальных диалогов - это задачка по упрощению математического выражения с радикалами из соседней темы. Здесь действительно достаточно точно сформулирована цель. Тезаурус пользователя, да, может оказаться узким или наоборот слишком широким. Рамануджана пользователь может не знать, или, наоборот, быть экспертом по дискретной математике. Но можно же прикинуть по упрощаемому выражению, что это "детская задача", а значит и пользователь "ребёнок".)))

-- 27.04.2026, 21:49 --

Оценка и эффективное использование тезауруса пользователя неразрывно связана с персонализацией модели - очень и очень перспективное направление.

 Re: Будущие перспективы ИИ (возможно, 4-я волна ИИ)
Спрашиваю ИИ google (бесплатный, не логинясь), можно ли как-нибудь взломать один популярный форумный движок. Можно, говорит, как раз нашли критическую уязвимость и даёт ссылки на сайты, на одном из которых вижу пруф концепт (недоделанный код для взлома). Ещё за несколько вопросов доделываю код и захожу на некоторый сайт как админ! До чего дошёл прогресс! До невиданных чудес! Заменяет нам мышленье механический процесс!

 Re: Будущие перспективы ИИ (возможно, 4-я волна ИИ)
george66, со всем категорически согласен, кроме одного - написание кода по взлому сайта это не мышление. Когда-то считалось мышлением умножение 237876 на 68761246 (это я попой сел на numPad) и детям запрещалось протаскивать в ГБОУ СОШ калькуляторы - теперь даже стыдно вспоминать. Потом считалось мышлением аналитическое взятие интегралов хитрыми подстановками - Вы же не считаете это мышлением? Уже давно с этим справляются системы символьной математики.

Мышлением является вот эта картина:
https://ic.pics.livejournal.com/sterlja ... iginal.jpg

Именно концепт, а не отрисовка. Первый раз я понял, что турки - великая нация, когда узнал, в каком количестве и как вольготно у них живут уличные коты. Второй раз - когда увидел вот это.

 Re: Будущие перспективы ИИ (возможно, 4-я волна ИИ)
Mihaylo в сообщении #1723322 писал(а):

Диалог в режиме "Один промпт - один ответ" - это вырожденный диалог, тривиальный. Имеет место, когда промпт хорошо сформулирован, цель и тезаурус пользователя прочитались удачно. Но, как правило, это не работает. И уже из первого промпта можно увидеть, что диалог требует нескольких циклов общения. Вместо этого, LLM пытаются как можно быстрее тривиализировать диалог - сделать развёрнутый завершающий ответ, который приходится нередко мимо цели и тезауруса пользователя.

Пример тривиальных диалогов - это задачка по упрощению математического выражения с радикалами из соседней темы. Здесь действительно достаточно точно сформулирована цель. Тезаурус пользователя, да, может оказаться узким или наоборот слишком широким. Рамануджана пользователь может не знать, или, наоборот, быть экспертом по дискретной математике. Но можно же прикинуть по упрощаемому выражению, что это "детская задача", а значит и пользователь "ребёнок".)))

.



Общение с моделями уже не в тренде. Сейчас их чаще используют как персональных ассистентов. Ты говоришь модели, что тебе нужно, и она это делает. Если результат тебе не нравится, говоришь, что нужно улучшить, - и она его улучшает. Общение - трата времени. Пусть агенты общаются между собой и сами ищут решение, а модель координирует своих агентов.

DeepSeek дали «детскую задачу» 27 апреля 2026 года. Tогда модель DeepSeek ее не решила.

Я дал тот же самый запрос GPT-5.6 Sol (ultra) и попросил оформить решение на русском языке в формате BBCode для публикации на форуме. Ниже привожу ответ модели без единой правки.



Решение

Положим
$$a=\sqrt[3]{2},
\qquad
c=\sqrt[9]{\frac{256}{729}}.$$
Так как $a^3=2$, то
$$c^3
=\left(\frac{2^8}{3^6}\right)^{1/3}
=\frac{2^{8/3}}{9}
=\frac{4a^2}{9}.$$
Раскрывая скобки и используя $a^3=2$, получаем
$$(1-a+a^2)^2=3(a^2-1),$$
и, следовательно,
$$(1-a+a^2)^3
=3(a^2-1)(1-a+a^2)
=9(a-1).$$
Кроме того,
$$8-4a^2=4(a^3-a^2)=4a^2(a-1).$$
Поэтому
$$\bigl(c(1-a+a^2)\bigr)^3
=c^3(1-a+a^2)^3
=\frac{4a^2}{9}\,9(a-1)
=8-4a^2.$$
Функция возведения в куб инъективна на множестве вещественных чисел, поэтому
$$\boxed{
\sqrt[3]{8-4\sqrt[3]{4}}
=\sqrt[9]{\frac{256}{729}}
\left(1-\sqrt[3]{2}+\sqrt[3]{4}\right)
}.$$
Выражение в правой части не содержит вложенных радикалов.

 [ Сообщений: 110 ]  На страницу Пред.  1 ... 4, 5, 6, 7, 8


Соглашение о конфиденциальности | Общие правила

Powered by phpBB © 2000, 2002, 2005, 2007 phpBB Group