Электронная таблица Gnumeric

Инструменты Gnumeric для статистиков

Показывать лекцию целиком

Инструменты статистической обработки данных находятся в пункте главного меню "Статистика" (рис. 5.1). В этой главе рассмотрим принципы работы большинства из них, поскольку от версии к версии добавляются новые инструменты и возможности.

5.1 Описательные статистики

Исследование возможностей Gnumeric по статистической обработке данных начнем с простейшей задачи – получения основных статистических характеристик выборки. В качестве исходных данных будем использовать диапазоны ячеек, заполненные последовательностью случайных чисел. Примеры данных здесь приводить не имеет смысла, поэтому будет описываться вид исходного модельного распределения и его параметры, а на рисунках будут приводиться диалоги формирования исходных данных и результаты.

(рис 5.1) Средства статистического анализа (рис 5.2) Выбор распределения для создания исходных данных

Для начала сформируем выборку с нормальным распределением, задав среднее значение 5 и стандартное отклонение 1. Это делается в помощью диалога "Генерация случайных чисел" (рис. 5.2), вызываемого из главного меню ("Правка/Заполнить/Генерация случайных чисел..." или "Данные/Заполнить/Генерация случайных чисел...").

На вкладке "Случайные числа" устанавливаем вид распределения (здесь названный "Дистрибутив") – Нормальное, Среднее значение – 5 и Стандартное отклонение – 1. На вкладке "Параметры" устанавливаем Число переменных – 1 и Размер выборки – 25 (рис. 5.3).

Наконец, на вкладке "Вывод" устанавливаем диапазон вывода – диапазон ячеек, начиная, например, с A4 на текущем листе (рис. 5.4). После нажатия на кнопки "Применить" и "ОК" будет получено 25 случайных чисел с заданным законом распределения.

Теперь получим базовые статистические характеристики этой выборки как будто мы про неё ничего не знаем. Для этого выделим наши данные и вызовем диалог "Описательные статистики" ("Статистика/Описательные статистики/Описательные статистики...") (рис. 5.5).

(рис 5.3) Определение параметров выборки (рис 5.4) Настройка размещения результатов (рис 5.5) Определение диапазона данных для обработки

На вкладке "Ввод" проверяем правильность диапазона ввода, на вкладке "Статистические" при необходимости уточняем доверительный интервал и другие параметры (можно все оставить по умолчанию, как на рис. 5.6). Наконец, на вкладке "Вывод" опять-таки задаем ячейку текущего листа, с которой начнется вывод результатов (рис. 5.7).

Очевидно, что раз 25 точек данных начинаются с A4, то имеет смысл выводить результаты статистического анализа после окончания данных. Хотя ничто не мешает вывести результаты на отдельный лист, это не очень удобно, если приходится сравнивать характеристики нескольких выборок.

В дальнейшем без особой необходимости все эти однотипные диалоги приводиться не будут. Теперь посмотрим на результаты обработки исходных данных – те самые описательные статистики для нормального распределения (рис. 5.8).

Из приведённых результатов видно, что сгенерированы были действительно случайные числа. Вычисленные по выборке значения близки к параметрам, по которым формировалась эта выборка, но совпадение не идеальное, т.е. фактор "случайности" действительно имеет место. Отсутствие значения для моды, вероятно, связано с тем, что исходная выборка воспринимается как вариативный ряд, в котором нет варианты с максимальной частотой, поскольку значения не повторяются.

(рис 5.6) Уточнение параметров обработки данных

Теперь проделаем те же операции для однородного распределения в диапазоне $$[-2;2]$$ и посмотрим на результаты (рис. 5.9).

Здесь стандартное отклонение очень велико по сравнению с диапазоном от минимума до максимума, что неудивительно для однородного распределения.

Таким образом, инструмент "Описательные статистики" позволяет получить практически все необходимые статистические характеристики имеющейся выборки.

5.2 Прогнозирование

Статистическое прогнозирование (в англоязычных статистических программах – forecasting) является на самом деле сглаживанием, которое применяется для выделения тенденции при сильном разбросе точек исходных данных. В Gnumeric эта процедура может проводиться двумя способами – методом экспоненциального сглаживания и методом скользящего среднего (соответственно, команды главного меню "Статистика/Зависимые наблюдения/Прогнозирование/Экспоненциальное сглаживание..." и "Статистика/Зависимые наблюдения/Прогнозирование/Скользящее среднее..."). При выборе сглаживания методом скользящего среднего можно указать количество точек, по которым будет проводиться усреднение.

(рис 5.7) Определение размещения результатов обработки (рис 5.8) Описательные статистики для нормального распределения (рис 5.9) Описательные статистики для однородного распределения

Рассмотрим пример с некоторыми экспериментальными данными (рис. 5.10). Вектор $$X$$ представляет собой некоторую независимую переменную, вектор $$Y$$ – измеренные значения. Правее приведены результаты экспоненциального сглаживания и сглаживания методом скользящего среднего по трем точкам. Поскольку при сглаживании для данного значения $$Y$$ оказываются задействованы предыдущие и последующие значения, то количество "сглаженных" точек меньше, чем количество исходных. Это видно как по отсутствию последнего значения в обоих случаях сглаживания, так и из сообщения "#N/A (нет данных)" в начале последовательности. Для скользящего среднего по трем точкам результат вообще начинается только с третьей точки последовательности.

График исходных данных и результатов сглаживания показан на рис. 5.11. Нужно заметить, что сами операции сглаживания ("прогнозирования") дают только числовые значения.

Из графика видно, что скользящее среднее (сплошная линия) в данном примере дает лучший результат, но чем больше точек участвуют в усреднении (и чем более гладкой получается кривая), тем больше точек в начале и в конце теряются.

(рис 5.10) Исходные данные и результаты сглаживания (рис 5.11) Графическое представление исходных данных и результатов сглаживания

5.3 Корреляция

Корреляционный анализ, как известно, позволяет выявить взаимосвязь двух случайных величин. Коэффициент корреляции (корреляция по Пирсону) может принимать значения от -1 до 1. Чем ближе к 1 абсолютная величина коэффициента корреляции, тем сильнее связаны исследуемые случайные величины.

Для примера рассмотрим несколько выборок. Первая выборка (назовем ее "Выборка1") является нормально распределенной случайной величиной со средним значением 5 и стандартным отклонением 1, вторая ("Выборка2") – также нормально распределенная случайная величина со средним значением 4 и стандартным отклонением 2, третья ("Выборка3") – случайная величина с однородным распределением в интервале $$[-2;2]$$. Четвертая выборка ("Выборка4") получена путем удвоения значений Выборки1 и добавления к результату десятой доли значений Выборки3 (т.е. Выборка4=2*Выборка1+Выборка3/10) в каждой точке.

Пусть в каждой выборке будет по 25 значений, и начинать генерацию исходных данных будем со столбца $$A$$. После создания выборок вызовем диалог "Корреляция" ("Статистика/Описательные статистики/Корреляция...", рис. 5.12).

Присвоение имён столбцам исходных данных и использование режима "Метки" в диалоге "Корреляция" позволяет на выходе получить именованные результаты (рис. 5.13).

Видно, что каждая выборка сама с собой прекрасно коррелирует (коэффициент равен 1), а четвертая выборка с первой дает коэффициент почти равный 1 (почти, но не совсем, поскольку Выборка4 искажена дополнительным влиянием Выборки3).

Для упражнения полезно вычислить коэффициент корреляции двух независимых выборок случайных величин с одинаковыми параметрами распределения.

5.4 Ковариация

Коэффициент ковариации также позволяет определить взаимосвязи случайных величин, но, в отличие от коэффициента корреляции, этот параметр не является нормированным, поэтому его значение не несет никакой очевидной информации. Более информативным является вычисление коэффициента корреляции. Посмотрим на результаты вычисления ковариации ("Статистика/Описательные статистики/Ковариация...") для тех же исходных данных, что и в примере вычисления корреляции (рис. 5.14).

(рис 5.12) Определение исходных данных для вычисления корреляции (рис 5.13) Результаты вычисления корреляции выборок (рис 5.14) Результат вычисления ковариации выборок

Видно, что без дополнительных усилий как-то интерпретировать результаты вычисления ковариации достаточно сложно.

5.5 Регрессия

Регрессия как элемент статистического анализа в Gnumeric проводится по линейной модели, а отклонения рассматриваются как нормально распределённые случайные ошибки. В результате проведения такого регрессионного анализа ("Статистика/Зависимые наблюдения/Регрессия...") вычисляется множество параметров.

Рассмотрим результаты регрессии для примера исходных данных, использованных ранее для сглаживания (см. рис. 5.10).

При создании иллюстрации (рис. 5.15) данные из длинных строчек (параметры "F" и "P") были перенесены вниз, т.е. в реальной таблице ячейки "F" и "Значимость F" находятся в той же строке, что и параметр "степень свободы", а значения параметров "P", "Ниже 95%" и "Выше 95%" - в тех же строках, что и значения коэффициентов регрессии.

По результатам выполнения регрессии можно получить следующее уравнение $$Y=-4.59*X+55.677$$. Параметр "Столбец1" дает коэффициент наклона прямой, а параметр "Пересечение" – точку пересечения прямой с осью $$Y$$.

Интересно сравнить результаты регрессионного анализа, проведенного таким образом, с уравнениями регрессии, которые можно получить на диаграмме XY (рис. 5.16).

На рис. 5.16 точками показаны исходные данные, пунктирной линией – линейная регрессия (верхнее уравнение), параметры которой в точности совпадают с вычисленными с помощью "статистического" регрессионного анализа. Сплошная линия и нижнее уравнение соответствуют экспоненциальной модели регрессии, которая дает гораздо лучший коэффициент определенности (критерий Пирсона).

(рис 5.15) Результаты регрессионного анализа экспериментальных данных (рис 5.16) Исходные данные и кривые регрессии на диаграмме XY (рис 5.17) Гауссова кривая и её Фурье-образ

Более подробно построение кривых регрессии будет рассматриваться в главе "Регрессионный анализ в Gnumeric".

5.6 Анализ Фурье

Модуль преобразования Фурье ("Статистика/Зависимые наблюдения/Анализ Фурье...") позволяет вычислять дискретное преобразование Фурье (ДПФ) для заданного ряда данных (режим "Инверсия" на вкладке "Параметры" диалога "Анализ Фурье" позволяет, по-видимому, вычислять обратное преобразование Фурье).

Рассмотрим два примера. Первый пример – преобразование Фурье для гауссовой кривой, задаваемой формулой (5.1).

$$y=e(-\frac{(x-x_0)^2}{\sigma^2})$$

Известно, что для такой функции Фурье-образ будет иметь вид такой же функции (с точностью до нормировки). Путь для простоты x0 имеет значение 0, а дисперсия пусть будет равна 4. Графики исходной функции (пунктир) и ее Фурье-образа (сплошная линия) показаны на рис. 5.17.

В Gnumeric вычисляются действительная и мнимая части Фурье-образа, так что для получения окончательного результата можно воспользоваться математической функцией hypot(), вычисляющей квадратный корень из суммы квадратов аргументов.

(рис 5.18) "Импульсная" функция и её Фурье-образ

Теперь попробуем получить Фурье-образ для периодической "прямоугольной" функции (прямоугольных импульсов), причем состояние "0" и состояние "1" длятся по половине периода (рис. 5.18).

По горизонтальной оси отложены некие условные единицы. Период исходной функции составляет 16 единиц (всего взято 64 точки). Фурье-образ показан более жирной линией. Видно, что Фурье-образ симметричен относительно середины горизонтальной оси. Чем больше точек по горизонтали взято и чем больше период исходной функции, тем больше компонентов ряда Фурье можно различить.

Специально для читателей с инженерным и техническим образованием нужно заметить, что на рис. 5.18 показан квадрат модуля Фурье-образа, что соответствует, например, распределению энергии при дифракции электромагнитных волн на периодической решетке. В полном соответствии с теорией дифракции для заданных параметров решетки "энергия" в первом порядке (первый слева пик) составляет около 10% абсолютной величины.

5.7 Гистограмма

Инструмент "Гистограмма" ("Статистика/Описательные статистики/Частотная таблица/Гистограмма...") вычисляет количество значений в выборке, попадающих в заданный интервал значений. Границы интервалов (отрезки, cutoffs) могут быть заданы заранее или вычислены исходя их максимального и минимального значений и желаемого количества интервалов (рис. 5.19).

(рис 5.19) Определение диапазонов значений для создания гистограммы

В качестве тестовых значений сформируем выборку из 39 нормально распределённых случайных величин со средним значением 5 и стандартным отклонением 2.

(На вкладке "Ввод" обычным образом задаётся диапазон ячеек с исходными данными, поэтому эту вкладку диалога настройки гистограммы не обсуждаем).

На вкладке "Двоичные" определяется способ учёта значений, на границах отрезков (рис. 5.20). Если какое-то значение точно (с учётом "машинного нуля") попадает на границу интервала (отрезка), то для границы, отмеченной квадратной скобкой ("[ " или " ]"), оно учитывается в этом интервале (отрезке), а для границы, отмеченной круглой скобкой – в соседнем (предыдущем или следующем).

На вкладке "Графики и параметры" нужно определить вид диаграммы, которая будет сформирована и формат вывода результатов. Достаточно разумно заказать вывод гистограммы и представления результатов в процентах, как показано на рис. 5.21.

Наконец, на вкладке "Вывод", как обычно в Gnumeric, определяется лист и диапазон ячеек на листе, в который будут выводиться результаты (рис. 5.22).

После нажатия на кнопку "ОК" строится гистограмма и вычисляются частоты попадания значений выборки в заданные отрезки. Однако позиция графика гистограммы и диапазона ячеек с результатами совпадают, поэтому график нужно отодвинуть, чтобы увидеть числа (см. рис. 5.23).

(рис 5.20) Определение правил учёта границ отрезков (рис 5.21) Определение вида получаемой диаграммы и формата вывода результатов (рис 5.22) Указание диапазона для вывода результатов

График гистограммы можно теперь настраивать обычным образом, изменяя размер, форматы вывода по осям, цвет для серии данных и т. д.

5.8 Выборка

С помощью диалога "Выборка" можно выбрать несколько серий данных из некоторого вектора данных. Для примера в качестве исходного вектора рассмотрим столбец чисел от 0 до 25 (назовем столбец словом "Данные"). В диалоге "Выборка" ("Статистика/Выборка...") на вкладке "Ввод", как обычно, определяется диапазон ячеек, содержащих исходные данные, на вкладке "Вывод" – расположение результатов.

Вкладка "Параметры" (рис. 5.24) заслуживает отдельного обсуждения.

Есть возможность задать периодическую выборку и случайную. Пример параметров для периодической выборки показан на рис. 5.24. Параметр "Смещение" определяет начальную позицию в векторе исходных данных. Для вектора, имеющего имя, его можно оставить равным 0, если на вкладке "Ввод" установлен режим "Метки" (всё становится понятным, если провести несколько экспериментов). Результат такой выборки показан на рис. 5.25.

(рис 5.23) Результаты вычислений и график гистограммы (рис 5.24) Определение параметров периодической выборки (рис 5.25) Результат трёх испытаний для периодической выборки (рис 5.26) Определение параметров случайной выборки

Видно, что при периодической выборке размер периода задаёт интервал между выбираемыми значениями (в данном примере выбирается каждое 5-е значение, начиная с номера 0), и в различных сериях (испытаниях) значения повторяются.

Пример параметров случайной выборки показан на рис. 5.26, а результат – на рис. 5.27.

(рис 5.27) Результат трёх испытаний при случайной выборке

Видно, что для случайной выборки количество точек определяется параметром "Размер выборки" и в различных сериях (испытаниях) значения не повторяются.

Инструмент "Выборка" может быть использован для превращения вектора данных в матрицу, а также для "прореживания" больших наборов исходных данных.

5.9 Ранги и процентили

Инструмент "Ранги и процентили" выполняет сортировку выборки по убыванию, определяет максимальное значение в выборке, присваивая ему первый ранг и значение в 100%, остальные значения выстраивает относительно первого и определяет, какой процент составляет текущая величина в выборке относительно максимального значения, а также указывает позицию каждого значения в выборке.

Рассмотрим, например, гипотетические результаты единого госэкзамена по ботанике среди группы в 25 участников (фамилии не указаны, поскольку они не используются для формирования данных). Таблица исходных данных приведена на рис. 5.28 (столбец "Баллы").

На вкладке "Параметры" диалога "Ранг и процентиль" (рис. 5.29) можно определить способ вычисления ранга (варианты "Средний ранг" и "Верхний ранг").

Поскольку требуется распределить весь набор значений на количество мест, равных количеству значений, то для повторяющихся значений получается деление мест (два одинаковых значения занимают два уровня рангов). Поэтому при использовании режима "Средний ранг" получаем дробные значения рангов (например, от 13 до 14 ранга имеется два значения, итого в среднем ранг получается 13,5). Результаты вычислений в таком режиме иллюстрируются группой "Средний ранг" на рис. 5.28.

(рис 5.28) Исходные данные и расчёты рангов и процентилей

При использовании режима "Верхний ранг" используется минимальное значение ранга для повторяющихся значений, что иллюстрируется группой "Верхний ранг" на рис. 5.28.

5.10 Дисперсионный анализ

Согласно определению, данному в классической книге В.Е.Гмурмана "Теория вероятностей и математическая статистика", "дисперсионный анализ (ДА) применяют, чтобы установить, оказывает ли существенное влияние некоторый качественный фактор $$F$$, который имеет $$p$$ уровней$$ F_1, F_2 ... F_p$$ на изучаемую величину $$X$$. Основная идея дисперсионного анализа состоит в сравнении "факторной дисперсии", порождаемой воздействие фактора, и "остаточной дисперсии", обусловленной случайными причинами. Если различие этих дисперсий значимо, то фактор оказывает существенное влияние на $$X$$.

(рис 5.29) Определения способа вычисления рангов

В более сложных случаях исследуют воздействие нескольких факторов на нескольких постоянных или случайных уровнях и выясняют влияние отдельных уровней и их комбинаций (многофакторный анализ)".

5.10.1 Однофакторный дисперсионный анализ

Рассмотрим пример однофакторного ДА на основе данных, взятых из учебного пособия "Статистические методы в инженерных исследованиях (лабораторный практикум)" (авторы Бородюк В.П., Вощинин А.П., Иванов А.З и др., см. список литературы).

Исследуется зависимость долговечности y электрических лампочек (в часах) от технологии изготовления (фактор x). В качестве исходных данных используется отклонение долговечности от "стандартного" значения в 1500 часов для 4-х неравночисленных серий образцов из разных партий (см. рис. 5.30).

В таблице приведены отклонения для различных образцов (y – номера образцов).

(рис 5.30) Исходные данные для однофакторного ДА (рис 5.31) Определение исходных данных для однофакторного ДА

Диалог определения исходных данных для однофакторного ДА "Статистика/Тесты с множеством выборок/Дисперсионный анализ/Однофакторынй..." показан на рис. 5.31.

Важно не включать в диапазон данных лишние ячейки, в данном случае – ячейки с названиями образцов, что обеспечивается включением режима "Метки".

На вкладке "Параметры" устанавливается уровень значимости "Альфа" (по умолчанию – общепринятое значение 5%).

(рис 5.32) Результаты однофакторного ДА

Вкладка "Вывод" – стандартная для всех диалогов статистического анализа, на ней определяется местоположение результатов вычислений.

Результаты показаны на рис. 5.32. Для повышения компактности вывода некоторые ячейки перенесены.

Какой же из этого всего следует вывод? А вывод такой: поскольку вычисленное значение результата "F" (F-критерий) меньше, чем "F критическое" для данного уровня значимости, влияние фактора (технологии изготовления) на исследуемый параметр (долговечность лампочек) является несущественным.

5.10.2 Двухфакторный дисперсионный анализ

В качестве примера применения Gnumeric для двухфакторного дисперсионного анализа рассмотрим задачу, приведенную в статье "Практикум по статистике с пакетами StatGraphics, Statistica, SPSS" на http://www.exponenta.ru/educat/systemat/goritskii/part2/LR7/2.asp (см. список литературы).

Исследуется урожайность четырех сортов пшеницы, ц/га (фактор А, 4 уровня) от используемого вида удобрений (5 уровней фактора B). Данные получены с 20 участков равной площади и одинакового почвенного состава. Требуется выяснить влияние сорта пшеницы и типа удобрений на урожайность.

Таблицы исходных данных приведена на рис. 5.33.

На рис. 5.34 показана вкладка "Ввод" диалога "Дисперсионный анализ: двухфакторный". Вкладки "Параметры" и "Вывод" являются стандартными, поэтому показывать их нет особого смысла.

(рис 5.33) Исходные данные для двухфакторного ДА (рис 5.34) Определение исходных данных для двухфакторного ДА (рис 5.35) Результаты двухфакторного ДА

Результаты вычислений показаны на рис. 5.35. Для уменьшения размера рисунка итоговые значений ("F", "P" и "F критическое") перенесены на другую строку.

При использовании Gnumeric получены те же значения уровней значимости P (0,153 и 0,225), что и в примере первоисточника. Соответственно, делается вывод о том, что в результате дисперсионного анализа не обнаружено влияние сорта пшеницы и типа удобрения на урожайность, что также видно из того, что при вычисленных уровнях значимости значения критерия F получаются меньше, чем соответствующие значения параметра "F критическое".

Нужно заметить, что использование свободно распространяемого пакета Gnumeric для решения подобных задач выглядит значительно привлекательнее использования пакета Statistica ценой около $700 USD, не говоря уже о StatGraphics или SPSS, легально приобрести которые весьма затруднительно.

5.11 Два средних

Вложенное меню "Два средних" ("Статистика/Тесты с двумя выборками/Два средних") предоставляет набор инструментов для проверки гипотезы о равенстве (или неравенстве) средних значений выборок (генеральных совокупностей). В качестве исходных данных будем средствами Gnumeric генерировать выборки с нормальным распределением.

(рис 5.36) Настройка исходных данных для проверки гипотезы

5.11.1 Равные выборки: T-тест

Пусть известно, что в двух выборках имеется равное количество значений случайных величин, и известно, что у этих выборок равные дисперсии. В данном случае T-тест дает возможность определить дисперсии и средние значения для этих выборок и посчитать разницу между средними.

Для примера рассмотрим 25 нормально распределенных случайных значений со средним значением 5 и стандартным отклонением 1 (Выборка1) и 25 нормально распределенных случайных значений со средним значением 7 и стандартным отклонением 1 (Выборка2).

На вкладке "Ввод" диалога "Проверка различия двух средних" ("Статистика/Тесты с двумя выборками/Два средних/Равные выборки: T-тест...") указываем диапазоны для исходных данных, причем нужно проследить, чтобы все адреса были абсолютными (см. рис. 5.36). Режим "Метки", как всегда, позволяет использовать в выводе названия векторов данных.

На вкладке "Выборки" (рис. 5.37) указываем, что данные непарные, дисперсии неизвестны, но равны.

(рис 5.37) Настройка режимов анализа (рис 5.38) Результаты проверки гипотезы

На рис. 5.38 показаны результаты вычислений, причем заметно прекрасное согласование результатов с заранее заданными параметрами выборок.

Проделав всё это с любыми модельными данными, в ячейках блока результатов можно увидеть формулы, по которым производятся расчеты.

(рис 5.39) Настройка режимов вычислений

5.11.2 Неравные выборки, равные дисперсии: T-тест

Теперь рассмотрим ситуацию, когда выборки имеют разное количество точек. Пусть параметры Выборки1 остаются прежними (25 точек, нормальное распределение, среднее значение 5 стандартное отклонение 1), а для Выборки2 установим следующие параметры – нормальное распределение со средним 7, стандартным отклонением 1 и количеством точек 20.

В этом случае на вкладке "Выборки" диалога "Проверка различия двух средних" все оставляем по умолчанию (рис. 5.39), и наблюдаем результаты (рис. 5.40).

Настройки режимов вычислений в этом случае совпадают с предыдущим случаем.

Опять-таки наблюдается соответствие результатов расчетов с заранее определенными параметрами выборок.

5.11.3 Неравные выборки, неравные дисперсии: T-тест

Используя те же параметры распределения для Выборки1, что и в предыдущих случаях, для Выборки2 возьмем 20 точек, среднее значение 7 и стандартное отклонение 2.

На вкладке "Выборки" установим режимы в соответствии с рис. 5.41 и посмотрим результат (рис. 5.42).

(рис 5.40) Результаты проверки гипотезы (рис 5.41) Настройка режимов вычислений (рис 5.42) Результаты проверки гипотезы (рис 5.43) Настройка режимов вычислений

5.11.4 Известные дисперсии: Z-тест

Применим эту процедуру к слегка измененным модельным данным. Пусть Выборка1 остается с прежними параметрами, а для Выборки2 (среднее 7, 20 точек) установим дисперсию 2, для чего стандартное отклонение должно быть установлено как 1,41.

На вкладке "Выборка" устанавливаем режимы и значения дисперсии в соответствии с рис. 5.43 и получаем результат, показанный на рис. 5.44.

(рис 5.44) Результаты проверки гипотезы (рис 5.45) F-тест. Равные дисперсии

5.12 Две дисперсии: F-тест.

Этот инструмент позволяет проверить гипотезу о равенстве (или неравенстве) двух дисперсий. В качестве исходных данных будем использовать те же модельные выборки, что и в случае проверки гипотезы о равенстве двух средних.

В качестве первого примера рассмотрим 25 нормально распределенных случайных значений со средним значением 5 и стандартным отклонением 1 (Выборка1) и 25 нормально распределенных случайных значений со средним значением 7 и стандартным отклонением 1 (Выборка2). В этом случае дисперсии однозначно равны.

Результат проведения теста показан на рис. 5.45.

(рис 5.46) F-тест. Неравные дисперсии

Теперь рассмотрим вариант, при котором дисперсии отличаются в два раза (Выборка3 и Выборка4). Результат теста показан на рис. 5.46.

Вывод получается следующий: чем сильнее отличаются дисперсии выборок, тем меньше значение $$F$$.

5.13 Оценка выживаемости (оценка Каплана-Майера)

Общие сведения о задаче анализа выживаемости можно получить в статье А.Б. Меркова "Об анализе выживаемости" или в руководствах по коммерческим статистическим пакетам (см. список литературы). Суть задачи заключается в том, чтобы по набору признаков (характеристик) определить время сохранения объектом этих характеристик ("время жизни") или распределение вероятностей сохранения характеристик в заданных пределах. Соответственно, можно строить прогнозы (предсказывать) среднее "время жизни" (время сохранения характеристик) таких объектов. Объектами могут быть вещества, устройства (приборы), сооружения и конструкции, а также живые существа. Чаще всего оценка выживаемости упоминается в связи с медицинской практикой.

В тех случаях, когда время наблюдения (продолжительность испытаний) меньше, чем "время жизни" конкретного объекта, получается, что "время жизни" точно не меньше времени наблюдения, а вот какое оно конкретно – узнать уже нельзя. Такие данные называются "цензурированными" (censored). Для группы объектов, участвующих в испытаниях возможны одновременно цензурированные и нецензурированные данные для различных экземпляров (например, при исследованиях срока службы энергосберегающих ламп в течение 10000 часов часть ламп вышла из строя в течение испытаний, а часть – так и не испортилась).

(рис 5.47) Пример исходных данных для анализа выживаемости

Пример использования Gnumeric для оценки выживаемости по Каплану-Майеру взят из справки по Gnumeric (Gnumeric 1.10.x).

Заготовим исходные данные в соответствии с рис. 5.47.

Первый столбец ("Длительность") означает время испытаний (наблюдений) для каждого исследуемого экземпляра. В столбце "Группа" задаётся принадлежность объекта к группе объектов (группы могут отличаться местоположением, периодом времени наблюдений и другими признаками и обстоятельствами). В данном примере имеется только две группы. Наконец, в третьем столбце указывается признак "цензурированности" данных (если в ячейке 1 – данные цензурированы).

Все данные носят дискретный характер ("время жизни" изменяется дискретно).

(рис 5.48) Настройка исходных данных для анализа

Диалог настройки анализа вызывается через вложенное меню "Статистика/Зависимые наблюдения". Сначала определяется набор исходных данных и их цензурированность (вкладка "Ввод" диалога, рис. 5.48). Использование цензурированных данных разрешается включением соответствующего режима (Permit censorship).

На вкладке "Группы" задаётся количество групп и номера, которые их определяют. Теоретически можно объединять несколько групп в одну, указав диапазон номеров "от" и "до" (рис. 5.49). Для установки номера группы используются поля со счётчиками (для редактирования поля нужно дважды щёлкнуть в нём левой кнопкой мыши).

В этом примере (и по умолчанию) используется две группы, но с помощью кнопок "Добавить" и "Удалить" количество групп можно изменять так, как требуется.

На вкладке "Параметры" (рис. 5.50) определяется объём итоговой информации. Различные виды результатов можно включать и выключать. Пусть в рассматриваемом примере будет выводиться максимально полный набор результатов.

Наконец, на вкладке "Вывод" (рис. 5.51) имеет смысл выбрать вариант создания нового листа, поскольку количество выводимых результатов достаточно велико.

В результате получается график, на котором отмечены точки с цензурированными данными для обеих групп (рис. 5.52), а также выдаются численные результаты. На рис. 5.52 результаты для первой группы показаны сплошной линией, цензурированные точки – треугольниками, а результаты для второй группы – "точечной" линией, цензурированные точки – ромбы.

(рис 5.49) Настройка групп исследуемых объектов (рис 5.50) Настройка результатов анализа (рис 5.51) Определение расположения результатов анализа

Численные результаты для первой группы показаны на рис. 5.53. Наличие деления на 0 при времени в 19 единиц, видимо, связано с тем, что для первой группы ("Группа0") нет нецензурированных данных для такого "времени жизни".

В следующих столбцах располагаются результаты для второй группы ("Группа1"). Для получения иллюстрации столбцы таблицы от $$B$$ до $$F$$ были скрыты (рис. 5.54).

Наконец, общее сравнение среднего времени выживаемости в группах обеспечивается тестом Log-Rank (рис. 5.55).

Значение $$p$$ позволяет оценить различие среднего времени жизни по группам. На основании полученной в рассматриваемом примере величины $$p$$ делается вывод, что эти значения статистически неразличимы.

(рис 5.52) Результаты анализа (функция выживания) (рис 5.53) Численные результаты для первой группы (рис 5.54) Численные результаты для второй группы (рис 5.55) Общая статистика по группам
Вернуться к учебному плану