Научный форум dxdy

Математика, Физика, Computer Science, Machine Learning, LaTeX, Механика и Техника, Химия,
Биология и Медицина, Экономика и Финансовая Математика, Гуманитарные науки




На страницу Пред.  1, 2
 Re: Статистический тест для полунормального распределения
Аватара пользователя
Geen в сообщении #1734169 писал(а):
А Вы что пытаетесь обосновать - наличие или отсутствие выброса?

Хороший вопрос ':) На самом деле там идёт конкретное натягивание совы на глобус. Я пытаюсь обосновать, являются ли две молекулярные структуры эквивалентны или нет, принимая, что у нас есть параметризованные через квантовый гармонический осциллятор распределения вероятностей смещения атомов. Так что и то и то я там обосновываю: у меня выбор, или это одна или та же структуры, или разные.
Combat Zone в сообщении #1734244 писал(а):
В общем, проверьте сперва, а точно ли распределение нормально. Если да - сходите к Гиббсу или Диксону, они простые. Если нет, попробуйте IQR.

Гарантировано не нормальное. Но исходя из такой гипотезы пытаюсь построить критерий схожести/различия структур.

-- добавлено через 3 минуты --

Я думаю будет чуть проще, если я выложу, что уже написано в статье с учётом предложенного критерия $\chi^2$.


У вас нет доступа для просмотра вложений в этом сообщении.

 Re: Статистический тест для полунормального распределения
Аватара пользователя
Рассматриваю задачу: дана выборка из наблюдений, предположительно порождённых полунормальным распределением с известной сигмой. Проверяется гипотеза, что выборка именно так и порождена.
Если сигма задана, можно без потери общности считать её единичной (а измерения поделить на сигму).
Полагаю, только среднего недостаточно, поскольку распределение суммы (и среднего) зависит от n.
А вот по среднему (или сумме) и общему числу наблюдений, полагаю, гипотезу проверять можно.
Как человек ленивый и с компьютером под рукой, я бы попытался получить таблицы критических значений вычислительным экспериментом. Скажем, для каждого n в интересующем диапазоне генерировал бы большое число (для определённости - 10000) испытаний, и в начестве критических значений взял бы отделяющие верхние и нижние 500 (это для $p=0.05$, для других значений другое число, лишь бы за "границей отсечения" были бы не единицы, а сотни).
И сравнивать с полученными критическими значениями.
"Иль правильней может, сжимая наган" - получить аналитическое решение, Возможный путь для этого - найти семиинварианты полунормального распределения, затем по ним получить семиинварианты распределения суммы, и уже по ним строить обратную функцию распределения. Но я не нашёл в справочниках значения семиинвариантов для этого распределения, только указание, что "для них нет простого выражения", а разлагать логарифм характеристической функции я не потяну.
https://en.wikipedia.org/wiki/Half-normal_distribution
Она выражается через некую "функцию Фадеевой"
https://en.wikipedia.org/wiki/Faddeeva_function
Правда, приведены выражения для асимметрии и эксцесса, по которым можно восстановить семиинварианты, по ним получить семиинварианты суммы, а по ним аппроксимировать обратную функцию.
Но если не ставить это, как самостоятельную математическую задачу, я бы ограничился численным моделированием.

 Re: Статистический тест для полунормального распределения
Аватара пользователя
Цитата:
Пусть безумная идея —
Вы не рубайте сгоряча.



madschumacher в сообщении #1734069 писал(а):
У меня есть n измерений случайной величины распределённой по полунормальному распределению $\xi \sim \exp(-\xi^2/(2\sigma^2) ), \ \xi \geq 0$.


Для каждого из $n$ измерений в выборке "подкинем честную монетку" и в зависимости от того, что выпало, изменим или не изменим знак измерения.
Получим выборку из $N(0,\sigma)$
Далее обычный z-тест для нормального распределения.

 Re: Статистический тест для полунормального распределения
Аватара пользователя
А в качестве аппроксимации, скажем, разложение Корниша-Фишера
https://en.wikipedia.org/wiki/Cornish%E ... _expansion
Ограничиваясь асимметрией и эксцессом, Для полунормального знчения приведены по ссылке в предыдущем сообщении, при этом для среднего асимметрия уменьшается в $n^{3/2}$ раз, а для эксцесса в $n^2$ раз.

 Re: Статистический тест для полунормального распределения
Аватара пользователя
madschumacher в сообщении #1734264 писал(а):
или это одна или та же структуры, или разные

Вообще говоря, может быть ситуация, когда ни на один вариант мы не можем дать положительный ответ.
И как дать положительный ответ об одинаковости я не понимаю - допустим структуры "почти одинаковые" - насколько мало может быть отклонение?

 Re: Статистический тест для полунормального распределения
madschumacher в сообщении #1734264 писал(а):
Я пытаюсь обосновать, являются ли две молекулярные структуры эквивалентны или нет, принимая, что у нас есть параметризованные через квантовый гармонический осциллятор распределения вероятностей смещения атомов. Так что и то и то я там обосновываю: у меня выбор, или это одна или та же структуры, или разные.

И если вы вкладываете в это общепринятый смысл, а не какой-то свой, то это уже то ли третья, то ли четвертая задача, поставленная вами, за третьи сутки. Вы кидаете камни по кустам, вдруг какой-то попадет куда надо.
Ну хорошо, теперь критерий Колмогорова-Смирнова посмотрите. (В некоторых источниках - просто Смирнова, потому что так и есть).
madschumacher в сообщении #1734264 писал(а):
Гарантировано не нормальное

Оно гарантированно не нормальное, но в статье вы пишете, что оно гарантированно нормальное. (???)
Обратите внимание, что если оно не нормальное, то сумма квадратов (у вас там пропущено слово) хи квадратом не будет.
И той чудесной статистики не получится. Если она вам нравится по психологическим причинам, я вас разочарую. Нет, это не популярный в узких кругах критерий Пирсона. Это просто следствие из определения распределения хи-квадрат.

Так вот непонятно - оно таки нормальное или нет? почему такая разница на словах здесь и в статье? А гистограмму вы строили? А раз выборка не одна, может, строили обе?

Самая печаль, что вы до сих пор не можете определиться с постановкой задачи. Это трудно, конечно. К тому же, вы не владеете терминологией и на всякий случай употребляете все слова, которые знаете, даже не подозревая, что такая процедура может радикально изменить задачу, и все, что было ранее, не годится.

Данные, конечно, ваши, реальных данных очень не хватает. Где нужно бы сперва
1. Построить гистограмму (и помнить какой именно выборки, из какой с.в.). Вы вот что замеряли? Расстояния по модулю или расстояния с учетом знака?
2. Если с учетом знака - полюбоваться на нее, скорее всего она будет именно нормальная или хотя бы симметричная.
3. Если нужно тупо сравнить две выборки - загоняем в Python, одной командой считаем нужную статистику (Смирнова).
4. Если нужно что-то пятое - думаем дальше. Мы еще не все слова перебрали :)

Что хи-квадрат тут не тот хи-квадрат не заметит только очень неопытный рецензент, хотя буковка, конечно, привлекательная.

 Re: Статистический тест для полунормального распределения
Аватара пользователя
Ну отчего же не тот хи-квадрат? В общем случае, конечно, сумма квадратов ненормального распределения будет не хи-квадрат, но тут ненормальность от взятия абсолютной величины, то есть сумма квадратов та же. То есть считать сумму квадратов и проверять хи-квадрат можно. Но тут скорее гипотеза о том, что сигма равна заданной.
Ещё вариант для "хи-квадрат иным манером" - разбиваем отрезок от нуля до бесконечности на куски (желательно равной вероятности в предположении верности гипотезы о распределении), считаем число попаданий и считаем хи=квадрат для $\chi^2=\sum\frac {(m_i-np_i)^2}{np_i}$

 Re: Статистический тест для полунормального распределения
Евгений Машеров в сообщении #1734290 писал(а):
Ну отчего же не тот хи-квадрат?

Распределение, конечно, то. Другого не бывает, и спорить никто не думал.
Но ТС всю дорогу при словах хи-квадрат добавляет еще и "критерий". Раз явно сказал: критерий Пирсона. Ну так не тот это хи-квадрат.

Вообще ничего страшного в этом не вижу, просто Пирсона нет. Некритично. Я больше о распределении беспокоюсь. То оно нормальное, то нет.

А дальше во всем остальном посте вы мне тщательно рассказываете мою же собственную идею, никаких протестов при входных данных что распределение нормально (или полунормально) у меня она не вызывает, кто ее тут писал-то?
Только тогда слагаемые точно были нормальные. А теперь точно не нормальные. Хочется уже выбраться на ровную почву.

 Re: Статистический тест для полунормального распределения
madschumacher
Давайте я попробую угадать, что происходило и почему "не нормальное". Если не угадаю, постою тогда в сторонке временно.

При условии, что ошибка (упорядоченное расстояние) действительно нормальна. Как вектор она многомерно нормальна. Но ваш условный (или нет) прибор) выдает вам строго модуль расстояния до вашего условного центра. То есть все наблюдения неотрицательны. Это вас и напрягло в свое время. На самом деле, все они (при условии нормировки дисперсиями по каждой оси) имеют хи квадрат распределение с тремя степенями свободы. Хи-квадраты мы складывать умеем, и когда сложим, получится как раз хи-квадрат распределение с $3n$ степенями свободы. То, что у вас там и фигурирует. Если дисперсии одинаковы, то оно там верно фигурирует.

И да, ваш единственный вариант проверять сигма такое, или испортилось - это вот этот способ.
Но сравнение выборок оно дает только косвенное. Выборка может испортиться и быть иначе распределенной, а дисперсия нет. Другое дело, это в теории. Скорее всего, на практике оно не может у вас произойти по чисто эмпирическим соображениям.

Резюме.
1. Если я вас сейчас понимаю правильно, то у вас там тоже все в порядке (в буковках я ничего не понимаю, такая ли дисперсия - это ваш удел проверять),
2. Критерий Пирсона по-прежнему не при делах.
3. Это проверка гипотезы о равенстве дисперсии, если реально нужна (вряд ли) проверка однородности выборок, то вам не сюда.

Пока все, наверное, в предпоследней серии мы друг друга с толку сбивали. Ну в смысле, мы с вами.

-- добавлено через 5 минут --

...Все не слава богу. Если верить вашему тексту, сигма у вас разные. Поломается тест.

 Re: Статистический тест для полунормального распределения
Upd Нет, не поломается. Просто нулевую гипотезу надо брать не про ско. Ее надо брать о средних, как вы и хотели изначально.

Тогда в предположении, что на сей раз моя интерпретация ваших слов верна и я все правильно понимаю, в качестве нулевой гипотезы нужно выдвинуть гипотезу о равенстве нулю матожидания дельт.

То есть, $H_0:\  \{\mathsf E (\delta x_k) = 0\}$ против альтернативной двусторонней $H_1:\  \{\mathsf E (\delta x_k) \ne 0\}$.
Правда, тогда придется текст несколько переделать, - что придется в любом случае, если придется ко двору этот фрагмент, расскажу, почему.

Так вот, в вашей ситуации нет иных способов проверить гипотезу о среднем, именно за счет разных сигм, кроме как статистика хи-квадрат. Да, в точности та, которая написана у вас. Посчитали, сверили с квантилью (не с квартилью), и приняли решение, отвергаем ли мы нулевую в пользу альтернативной.

 Re: Статистический тест для полунормального распределения
Аватара пользователя
Я тут вижу по крайней мере 3 задачи, и мне не вполне ясно, какая из них нужна топикстартеру.
1. Гипотеза о том, что распределение - полунормальное с известной дисперсией
2. Гипотеза о том, что распределение полунормальное с неизвестной (оцениваемой по выборке) дисперсией.
3. Гипотеза о том, что дисперсия равна заданной (полунормальность постулируется)
Кроме того, тут есть три вида доступной информации - среднее (или сумма) наблюдений, сумма квадратов наблюдений, все наблюдения (вариационный ряд).
Вторая задача не может быть решена, зная лишь среднее или сумму квадратов, поскольку можно подобрать этот параметр, чтобы он соответствовал наблюдаемым величинам. Нужен весь вариационный ряд. Можно Колмогоровым-Смирновым, можно омега-квадрат, я бы использовал критерий хи-квадрат, разбив область изменения на интервалы и построя таблицу частостей, сопоставив их с вероятностями (но это мои вкусы, никому не навязываю). Поскольку во второй задаче один параметр оценивается по выборке, на одну степень свободы меньше. Для первой и третьей такого вычитания нет, число степеней свободы на единицу меньше числа интервалов.
По сумме или сумме квадратов наблюдений можно сколько-нибудь надёжно проверять третью гипотезу, для первой можно её отвергнуть, но вполне можно получить согласие с гипотезой при распределении, сильно отличной от полунормального, относительно второй гипотезы вообще ничего непонятно.
В предположении полунормальности и известной дисперсии сумма квадратов нормированных СКО наблюдений имеет распределение $\chi^2$ с n степенями свободы, и критические значения для отвержения гипотезы просто выписываются из соответствующей таблицы. Распределение суммы значений, насколько я смог понять из литературы, в явном виде не описано, но может быть аппроксимировано, скажем, разложением Корниша-Фишера, используя значения асимметрии и эксцесса для полунормального распределения и из изменение для суммы из n наблюдений. Мне кажется, это самый трудоёмкий путь и оправдан лишь в случае, когда отдельные значения недоступны, а регистрируется лишь их сумма.

 [ Сообщений: 26 ]  На страницу Пред.  1, 2


Соглашение о конфиденциальности | Общие правила

Powered by phpBB © 2000, 2002, 2005, 2007 phpBB Group