Научный форум dxdy

Математика, Физика, Computer Science, Machine Learning, LaTeX, Механика и Техника, Химия,
Биология и Медицина, Экономика и Финансовая Математика, Гуманитарные науки




 Самый мощный ИИ в области физики и математики
Аватара пользователя
Какой на Ваш взгляд на данный момент самый "неплохой" ИИ в области теоретической физики и математического анализа. Прошу поделиться собственным опытом и мнением.

 Re: Самый мощный ИИ в области физики и математики
Аватара пользователя
ChatGPT и Claude - безусловные лидеры.

 Re: Самый мощный ИИ в области физики и математики
Аватара пользователя
Qwen 3.8 Max очень даже неплох

 Re: Самый мощный ИИ в области физики и математики
reterty в сообщении #1730390 писал(а):
Qwen 3.8 Max очень даже неплох

При взаимодействым с Qwen 3.8 Max он очень часто предлагает выбрать из двух параллельно предлагаемых ответов. Причем, каких-то принципиальных различий в ответах я не заметил. Есть ли такое поведение у других AI ?

 Re: Самый мощный ИИ в области физики и математики
druggist в сообщении #1733997 писал(а):
Есть ли такое поведение у других AI ?

У chatGPT то же самое, во всяком случае, у бесплатной версии.

 Re: Самый мощный ИИ в области физики и математики
Аватара пользователя
druggist в сообщении #1733997 писал(а):
Есть ли такое поведение у других AI ?
Да, это многие предлагают. Могут быть ответы как от немного разных версий, так и просто две попытки от одной модели. Очень полезный сигнал для обучения.

 Re: Самый мощный ИИ в области физики и математики
Аватара пользователя
druggist в сообщении #1733997 писал(а):
При взаимодействым с Qwen 3.8 Max он очень часто предлагает выбрать из двух параллельно предлагаемых ответов.
А он пишет, зачем он так делает?
Например, ChatGPT изредка так делает (во всяком случае, делал до появления версии Sol в июле 2026 г.), когда разработчики тестируют новую версию. То есть запрос пользователя посылается текущей версии ChatGPT и он же посылается новой версии, ещё не вышедшей. Для чистоты эксперимента пользователю не сообщают, где ответ старой версии, а где ответ новой, и предлагают выбрать ответ получше. Чтобы получить обратную связь о том, насколько хороша новая модель.

С июля в платной версии я такого не наблюдал - возможно, потому, что при сравнении самых современных моделей полагаться на "помощь зала" (ощущения аудитории) уже нельзя. Грубых ошибок, заметных широкой аудитории, как правило, не совершают ни Sol, ни Astra.

Тогда понятно, почему это сохранилось в бесплатной версии. Там сейчас стоит модель Luna, которая явные ошибки совершать как раз может и в которой, вероятно, что-то ещё докручивают.

 Re: Самый мощный ИИ в области физики и математики
reterty в сообщении #1730381 писал(а):
самый "неплохой" ИИ в области теоретической физики

Спросил ChatGPT.
Цитата:
Итоговый баланс сил в физике
DeepSeek (R1): Лучший «теоретик». Идеально выводит формулы из головы.
ChatGPT (o1/o3): Лучший «учитель». Отлично объясняет концепции и пишет код для физических симуляций.
Qwen (2.5-VL): Отличный open-source инструмент для работы со схемами, если вам нужна конфиденциальность.
Gemini (1.5 Pro): Лучший «исследователь». Идеален, когда нужно проанализировать огромный объем физических данных, прочитать видеозапись эксперимента или связать сложный график с текстом задачи.

 Re: Самый мощный ИИ в области физики и математики
Аватара пользователя
chislo_avogadro в сообщении #1734002 писал(а):
Спросил ChatGPT.
Это Вы явно запустили ChatGPT на каком-то очень низком уровне размышления, возможно без доступа к интернету. Какие ещё o1/o3 в сентябре 2026. Да и остальные тоже.
Приведу выдержки из ответа ChatGPT 5.6 Sol на уровне High на данный вопрос:
Цитата:
Среди доступных пользователю универсальных ИИ я бы сейчас поставил на первое место GPT-6 Astra; в ChatGPT её наиболее мощная пользовательская форма — GPT-6 Pro.
<...>
В математике Astra сейчас выглядит наиболее убедительным лидером
Здесь появились гораздо более серьёзные основания, чем обычные олимпиадные тесты.
На FrontierMath Tier 4, где задачи относятся уже к исследовательскому уровню, результаты таковы:
GPT-6 Astra — 97.6%;
Claude Fable 5.1 — 87.8%;
GPT-5.6 Sol — около 83%.
<...>
С теоретической физикой ситуация интереснее
Совсем недавно появился особенно полезный тест — CritPt (Complex Research using Integrated Thinking – Physics Test).
Это не школьная и не олимпиадная физика. В нём 71 составная задача исследовательского уровня, подготовленная более чем 50 действующими физиками.
<...>
И здесь на начало сентября результаты следующие:
$$ \begin{array}{c|c} \text{модель} & \text{CritPt}\\ \hline \text{GPT-5.6 Sol} & 32.3\%\\ \text{GPT-6 Astra} & 31.7\%\\ \text{Claude Fable 5.1} & \approx31\%\\ \end{array} $$
То есть формально первый сейчас GPT-5.6 Sol, а не Astra.
Но разница $32.3\%-31.7\%=0.6$ процентного пункта настолько мала, что я бы не делал отсюда вывода «Sol умнее Astra в физике».
<...>
Есть ещё Gemini Deep Think
Его тоже нельзя списывать со счетов. Gemini 3.1 Deep Think демонстрировал очень высокие результаты именно в физике:
$87.7\%$ на теоретической части International Physics Olympiad 2025;
$50.5\%$ на CMT-Benchmark по теории конденсированного состояния.
На момент публикации это были чрезвычайно сильные результаты.
Ещё интереснее специализированная система Gemini Deep Think + tree search + численная обратная связь: Google описывает работу, в которой такая система решила открытую задачу теоретической физики, связанную со спектром гравитационного излучения космических струн, и нашла несколько аналитических методов решения.


-- добавлено через 23 минуты --

chislo_avogadro в сообщении #1734002 писал(а):
DeepSeek (R1): Лучший «теоретик». Идеально выводит формулы из головы.
Где, интересно, у него голова? :D
Этого "лучшего теоретика" недавно поймали на списывании: согласно сообщению Anthropic, часть пользовательских запросов DeepSeek и другие китайские ИИ просто перенаправляли Claude'у, а не отвечали на них сами.
Вероятно, этим и объясняются периоды, когда DeepSeek внезапно резко умнел, а потом снова глупел. Их даже здесь на форуме отмечали.
А ещё китайские ИИ раньше ловили на том, что иногда они на вопрос "кто ты?" отвечали "я Клод". То ли дело тут было в дистилляции западных моделей (обучении на диалогах с ними), то ли просто в банальном перенаправлении запроса.

Конечно, если доступ к западным ИИ россиянам перекроют совсем серьёзно, с той или с другой стороны, то, возможно, придётся пользоваться китайскими. Но это искусственный интеллект второй свежести.

 Re: Самый мощный ИИ в области физики и математики
Аватара пользователя
mihaild в сообщении #1733999 писал(а):
Да, это многие предлагают. Могут быть ответы как от немного разных версий, так и просто две попытки от одной модели. Очень полезный сигнал для обучения.

Интересно, а какая ему будет польза от того, что я ткну случайно, не увидев никаких существенных различий?

 Re: Самый мощный ИИ в области физики и математики
Аватара пользователя
epros в сообщении #1734027 писал(а):
Интересно, а какая ему будет польза от того, что я ткну случайно, не увидев никаких существенных различий?
Для пользы достаточно, чтобы различия хотя бы иногда были, и, когда они есть, выбор с ними коррелировал.
Использовать можно по-разному. Можно оценивать качество модели. Можно учить модель генерировать те варианты, которые пользователи выбрали как лучшие.
Шума много, но (гипотетически) он усредняется в ноль.

 Re: Самый мощный ИИ в области физики и математики
Тут при ответе надо сообщать, какой конкретно версией того или иного ИИ пользовался отвечающий (для решения каких-то задач), т.е. это личный опыт или некая почерпнутая откуда-то информация.

Я вот напр. из ИИ пользовался только общедоступной бесплатной версией Gemini. Я эту бесплатную версию использую для составления научных обзоров по интересным мне напрвлениям, прошу "state-of-the-art methods" и "references". В плане "state-of-the-art methods" все не совсем бесполезно, но достаточно поверхностно, сиюминутно, подвержено влиянию информационного шума, научного маркетинга, громких фраз в статьях итд... Ни о каком экспертном мнении тут речи и быть не может. Среди приводимых ссылок на источники много ГАЛЛЮЦИНАЦИЙ и "галлюцинаторных гибридов": несуществующие названия статей; название от одной статьи, авторы от другой.

Переспрашиваешь по поводу "недостоверной ссылки", отвечает: "Вы правы, извините. Приведенная ссылка является "галлюцинаторным гибридом" (это термин Gemini)".... И взамен приводит новые статьи, так же обильно содержащие "галлюцинаторные гибриды".

Если говорить о программировании, то там могут возникать галлюцинаторные суждения о функционале тех или иных библилотечных функций, могут упоминаться/рекомендоваться несуществующие функции, несуществующие значения опций и параметров.

Как-то так.

 Re: Самый мощный ИИ в области физики и математики
Текущие рейтинги нейронок.
https://arena.ai/leaderboard/

 [ Сообщений: 13 ] 


Соглашение о конфиденциальности | Общие правила

Powered by phpBB © 2000, 2002, 2005, 2007 phpBB Group