Тестирование в современном высшем образовании

Обоснование качества теста

Показывать лекцию целиком

5.1. Критерии и методологии

Любое тестирование завершается математико-статистической обработкой данных тестирования и поиском причинно-следственных связей между параметрами тестирования (теста, заданий) результатами тестирования (качеством обучения).

Математико-статистический аппарат и поддерживающий его компьютерный инструментарий для обработки данных полноправно используются в теории педагогических измерений.

Согласно той или иной цели обработки результатов тестирования используют следующие основные методологии (теории):

  • Classical Test Theory (КТТ) или классическая теория, которая позволяет найти оценки надежности измерений, согласованности и однородности тестовых заданий, валидности теста в целом на основе линейных преобразований "сырых" баллов, позволяет повысить сопоставимость результатов тестирования для различных групп испытуемых, без изменения порядковой шкалы результатов теста;
  • Generalizability Theory (GT) или модификация КТТ на базе дисперсионного анализа ошибок измерений, выявления их источников;
  • Item Response Theory (IRT) или оценки скрытых (латентных) параметров испытания (испытуемых и теста), рассматривая их распределения как непрерывные, используя интервальную шкалу, повышающую устойчивость и объективность оценок трудности заданий, независимость их от выборки испытуемых;
  • Equating/Linking (E/L) или использование "разномастных" процедур измерения (шкалирование, выравнивание и др.), что эффективно при междисциплинарном тестировании.
  • Российская тестология чаще использует CTT и IRT. В классической теории, работа по оценке качества результатов тестирования по надёжности и валидности называется Item Analysis.

    При крупномасштабном тестировании (национального масштаба, например) появляется необходимость в одновременном использовании нескольких методологий.

    Пример. При национальном тестировании в США методологию КТТ используют для нахождения типичных коэффициентов надежности, GT – для описания их вариации, IRT – для адаптивного тестирования, а E/L – для получения итоговой оценки учебных достижений по результатам испытаний от поступления обучаемого до окончания им учебного заведения (до итоговой аттестации). Так выявляется динамика личностного развития.

    Но основным критерием выбора методологии, математико-статистической теории при обработке результатов тестирования является полезность, информативность получаемых результатов.

    Каковы остальные важные критерии для выбора тестов и тестирования?

    К ним относятся:

  • надежность теста, оцениваемая коэффициентом корреляции Пирсона между параллельными тестами на одной выборке, коэффициентом корреляции результатов практического тестирования и экспертных опенок, коэффициентом корреляции Спирмана-Брауна, коэффициентами надежности по Гутману или KR-20 и др.;
  • валидность теста, оцениваемая на основе гипотезы нормальности распределения результатов тестирования и стандартного распределения ошибок (регрессионная модель) или стандартной "подгонкой" под такое распределение (ее модификацию, например, трансформацией шкалы – логонормальное распределение и логиты);
  • дискриминативность теста, оценивающая способность теста отделять испытуемых с высокой продуктивностью от испытуемых с низкой продуктивностью учебной деятельности в достаточно большой выборке и с использованием, например, модели Раша (G. Rasch);
  • трудность теста, оцениваемая индексом трудности (она рассмотрена подробно выше).
  • Эти основные критерии и процедуры не исчерпывают имеющееся значительное их количество. В идеале, они должны использоваться итерационно, интегрально, многокритериально и эволюционно.

    Компетентностный подход к профессиональному образованию усиливает необходимость такого подхода к оцениванию качества обучения. Особенно, при использовании адаптивного, компьютерного обучения и тестирования.

    Пример. В распространенной системе дистанционного обучения Moodle имеются процедуры оценки следующих показателей:

  • индекс лёгкости (доля студентов, ответивших правильно на поставленный в задании вопрос);
  • стандартное отклонение;
  • случайная оценка угадывания (оценка при случайном угадывании варианта правильного ответа);
  • индекс дискриминации;
  • эффективность дифференциации и др.
  • Несмотря на наличие и важность таких оценок, при оценке качества тестов, тестирования должен учитываться и "стар-ап" – уровень подготовки студентов. Педагогические измерения зависят от личности и целевой группы испытуемых, для которых тест разработан.

    Такие аспекты качества, как приемлемость гипотезы измерений, цели тестирования (не только метрические, но и педагогические, психологические и др.), представительная группа испытуемых и другие также должны быть учтены. Сами же тестовые баллы – результаты тестирования, которые не всегда можно интерпретировать как результаты качества обучения.

    Каждая методология, метод оценки качества имеет свои "плюсы" и "минусы". Как и сама практика оценки знаний.

    У последней, видимо, минусов больше (стихийность, нерациональность, не дидактичность, игнорирование особенностей предмета, целевой аудитории и др.).

    5.2. Задачи и алгоритмы оценки

    Рассмотрим некоторые базовые понятия и задачи (алгоритмы) проведения оценивания по любой методологии. Сам класс таких задач – весьма широк.

    Задача 1. Пусть даны результаты тестирования группы, состоящей из n испытуемых для заданного теста из m различных знаний. Обычно эти данные представляются в виде некоторой матрицы A баллов размерности n на m:

    $$A(n\times m)=\begin{Vmatrix}a_{11}a_{12}\dotsa_{1m}\\a_{21}a_{22}\dotsa_{2m}\\\dots\dots\dots\dots\\a_{n1}a_{n2}\dotsa_{nm}\\\end{Vmatrix}=\|a_{ij}\|_{i=\overline{1,n}}^{j=\overline{1,m}}$$

    Элемент aij матрицы A представляет собой результат выполнения j-го задания для i-го тестируемого.

    Необходимо на основе имеющихся результатов x1, x2, ..., xn тестирования для каждого из n тестированных, вычислить основные статистические показатели тестирования (оценить "сырые" результаты) для выбранной случайным образом группы тестированных.

    Алгоритм решения этой задачи состоит из следующих этапов.

  • Упорядочиваем ряд по возрастанию (находим генеральную совокупность): x1<x2<...> xn.
  • Выбираем интересующее нас подмножество тестированных (выборку).
  • Находим среднее арифметическое по выборке $$\bar x=\frac{x_1+x_2+\cdots+x_n}{n}.$$
  • Находим величины, характеризующие структурные изменения, например, моду и медиану. Для данных, имеющих "хорошее поведение", медиана всегда лежит в промежутке между средним арифметическим и модой. Эти величины выстраиваются по возрастанию следующим образом: среднее, медиана, мода, или же в обратном порядке. Прямой или обратный порядок их расположения можно определить, вычислив так называемый коэффициент асимметрии:$$K=\frac{\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar x)^3}{(\sqrt{\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar x)^2})^3}.$$Этот коэффициент отражает относительную изменчивость данных.
  • Находим меры рассеяния, разброса или вариации, показывающие, как остальные элементы совокупности (выборки) группируются около средних величин. Например,
  • размах $$r_x=x_{\max} – x_{\min} = x_n – x_1;$$
  • среднее абсолютное отклонение $$r_{cp}=\frac{1}{n}\sum_{i=1}^{n}|x_i-\bar x|;$$
  • среднеквадратичное отклонение $$\delta x=\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar x)^2=\frac{1}{n}(\sum_{i=1}^{n}x_i^2-n x^{-2});$$
  • дисперсия $$D=\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar x)^2=\frac{1}{n-1}(\sum_{i=1}^{n}x_i^2-n x^{-2});$$
  • стандартное отклонение: $$\sigma=\sqrt{D};$$
  • коэффициент вариации $$\nu=\sigma/\bar x.$$
  • Конец алгоритма.
  • Задача 2. Даны результаты тестирования для каждого из n тестированных и теста длины m в виде матрицы A, а также вектор эталонных ответов B=(b1, b2, …, bm), где bj – эталонный ответ на задание номер j. Необходимо определить "вес" (меру сложности) конкретного задания теста.

    Простейший алгоритм решения этой задачи состоит из следующих этапов.

  • Определяем для очередного задания теста по матрице А количество тестированных, давших правильный ответ на данное задание.
  • В качестве "веса" задания берется дробь cj: знаменатель – количество тестированных, числитель – количество тестированных, давших правильные ответы на все задания.
  • Вычисляем смежные веса di: знаменатель – количество всех тестированных, давших неправильный ответ на данное задание номер j, числитель – количество тестированных, давших неправильные ответы на все задания. Иногда в знаменателе берется количество всех тестированных.
  • Находится вектор весов выполнения c=(c1, c2, …, cm) для заданного вектора b эталонных ответов.
  • Находим вектор весов невыполнения d=(d1, d2, …, dm) для заданного вектора b эталонных ответов.
  • Оцениваем дисперсию каждого j-го задания Djidi и стандартное отклонение $$\sigma_j=\sqrt{D_j}$$.
  • Конец алгоритма.
  • Задача 3. Даны результаты тестирования для каждого из n тестированных и теста длины m в виде матрицы A, а также вектор эталонных ответов B=(b1, b2, …, bm), где bj – эталонный ответ на задание номер j. Необходимо оценить валидность каждого задания теста.

    Простейший алгоритм решения этой задачи состоит из следующих этапов.

  • Определяем для очередного задания теста по матрице A количество тестированных, давших правильный ответ на j-ое задание и находим их средний балл xj.
  • Находим аналогично количество тестированных, давших неправильный ответ на j-ое задание и их средний балл yj.
  • Находим дробь cj: знаменатель – количество тестированных, давших правильный ответ на данное задание номер j, числитель – количество тестированных.
  • Находим дробь di: знаменатель – количество тестированных, давших неправильный ответ на данное задание номер j, числитель – количество тестированных.
  • Оцениваем дисперсию каждого j-го задания Djidi и стандартное отклонение $$\sigma_j=\sqrt{D_j}$$.
  • Находим стандартное отклонение $$\sigma=\sqrt{D}$$ по всему тесту.
  • Находим коэффициент корреляции (меру валидности задания):$$r_j = \frac {(x_j-y_j)\sigma_j}{\sigma}$$
  • Если rj>0,3, то задание считаем валидным, иначе – не валидным (с точки зрения критериальной валидности, задания, выполненные всеми или невыполненные никем, не являются валидными).
  • Конец алгоритма.
  • Задача 4. Даны результаты нормативно-ориентированного тестирования для каждого из n тестированных и теста длины m в виде матрицы A, а также вектор эталонных ответов B=(b1, b2, …, bm), где bj – эталонный ответ на задание номер j. Необходимо оценить надежность теста (степень устойчивости результатов тестирования каждого испытуемого, если тестирование было проведено в совершенно одинаковых условиях).

    Для вычисления надежности нормативно-ориентированного теста используем коэффициент корреляции между результатами двух параллельных тестов. Сравнивая коэффициенты корреляции, делаем заключение о надежности (внутренней) теста. Если две половины теста коррелированы, то и тест надёжен; в противном случае – не надёжен (или необходимо применить другой, более тонкий математический аппарат исследования надежности).

    Простой алгоритм решения этой задачи состоит из следующих этапов.

  • Делим тест на две равные части X и Y, например, по четным и нечетным номерам заданий. Этот метод называется методом расщепления теста. Таким образом, мы имеем данные по двум параллельным тестам X и Y – индивидуальные баллы (x1, x2, …, xn), (y1, y2, …, yn), где n – количество тестированных.
  • Для каждого задания группы X выполняем предыдущий алгоритм.
  • Для каждого задания группы Y выполняем предыдущий алгоритм.
  • Находим коэффициент корреляции X и Y по формуле: $$r_{XY}=\frac{\sum_{i=1}^{n}x_iy_i-\frac{1}{n}\sum_{i=1}^{n}y_i}{\sqrt{\sum_{i=1}^{n}x_i^2-\frac{1}{n}(\sum_{i=1}^{n}x_i)^2}\cdot\sqrt{\sum_{i=1}^{n}y_i^2-\frac{1}{n}(\sum_{i=1}^{n}y_i)^2}}.$$
  • Находим надежность r всего теста по формуле (Спирмена-Брауна):$$r=\frac{2r_{XY}}{1+r_{XY}}.$$
  • Конец алгоритма.
  • Задача 5. Необходимо на основе имеющихся результатов тестирования (матрица А) получить для каждого из n тестированных интегральный (обобщенный) показатель выполнения теста длины m, а затем по вычисленным значениям этого интегрального показателя разбить всех тестированных на заданное количество k групп.

    Алгоритм решения этой задачи состоит из следующих этапов.

  • Если для j-го задания увеличение значений результатов измерения свидетельствует об улучшении соответствующего свойства, то с ним свяжем признак zj=1, а если свидетельствует об ухудшении – признак zj=–1.
  • Выполняем нормирование элементов исходной матрицы так, чтобы в каждом столбце они изменялись в "одном направлении": для каждого задания (при фиксированном j=1, 2, …, m) и для каждого испытуемого i=1, 2, …, n вычислим новое значение$$a_{ij}:=\frac{a_{ij}-m_j}{M_j-m_j},$$ где Mj, mj – наибольшее и наименьшее значения элементов j-го столбца и применяем преобразование вида $$a_{ij}:=\left\{\begin{aligned}a_{ij},z_j=1\\1-a_{ij},z_{ij}=-1.\\\end{aligned}\right.$$
  • Для каждого столбца полученной новой матрицы А (нормированной) вычисляется среднее квадратичное отклонение по формуле$$c_{j}=\sqrt{\frac{\sum_{i=1}^{n}(a_{ij}-\bar a_j)^2}{n-1}},$$ где $$\bar a_j$$– среднее арифметическое элементов j-го столбца.
  • Вычисляется классификационный интегральный показатель $$y_i=\sum_{j=1}^{m}a_{ij}c_i,$$ где yi – значение интегрального показателя для i-го обучаемого i=(1,2,…,n), cj – весовой коэффициент j-го задания в тесте или в банке всех заданий, a ij– элемент матрицы А или его преобразованное (нормированное, например, по отношению к максимальному элементу или к норме матрицы).
  • Находим наименьшее ymin и ymax наибольшее значения интегрального показателя (по всем тестированным). Отрезок [yminymax;] делим на заданное число k интервалов. Часто берут (при построении, например, гистограммы) k=1+3,2lgn. Всех тестированных, для которых вычисленные значения интегрального показателя попадают в один и тот же интервал, отождествляем и относим к одному классу.
  • Выдаем результаты: значения интегрального показателя для каждого тестированного, а также его класс (или классификацию тестированных по интегральному показателю).
  • Конец алгоритма.
  • Задача 6. Есть результаты тестирования, полученные в виде матрицы А. Необходимо разбить всех тестированных на несколько групп по отношению к норме (сильные, средние, слабые), где величина x – норма для тестовых результатов и величина k – масштабный коэффициент.

    Алгоритм решения задачи.

  • Ввод данных: n, m, A, k.
  • Для каждого из тестированных определяем его суммарный балл: $$b_i=\sum_{j=1}^{m}a_{ij}.$$
  • Разбиваем рассматриваемую выборку тестированных на 3 группы. В первую группу попадают с высокими баллами: суммарный балл для попадающих в эту группу не ниже значения выражения $$\min\{b_i\}+k(\max\{b_i\}-b_i).$$
  • В третью группу попадают с низкими баллами – не выше значения выражения $$\min\{b_i\}+(1-k)(\max\{b_i\}-b_i).$$
  • Во вторую группу попадают все остальные (со средними баллами).
  • Выдача результатов: количество и состав попавших в каждую группу.
  • Конец алгоритма.
  • Задача 7. Необходимо отсеять первичные ("сырые") результаты в группах, т.е. по данным x1, x2, …, xn (процент выполнения, валидность и т.д.) выяснить задания (тесты, результаты), которые не согласуются с общей картиной тестирования.

    Алгоритм решения задачи состоит из следующих этапов.

  • Вычисляется средняя величина $$\bar x.$$
  • Вычисляются наибольшее xmax и наименьшее xmin в группе.
  • Вычисляются наибольшее отклонение в группе: $$d_{\max}=|x_{\min(\max)}-\bar x|.$$
  • Вычисляется относительное отклонение: $$w=d_{\max}/\bar x.$$
  • Находим по таблице распределения Стьюдента процентные точки для t(5%) и t(0.1%). Таблица Стьюдента имеется практически во всех справочниках по математической статистике и в математических пакетах.
  • Вычисляем соответствующие точки w(5%;n), w(0.1%;n).
  • Если $$w(5\%;n)>t(5\%) (w(0.1\%;n)>t(0.1\%)),$$ то отсеиваем рассматриваемое данное и пересчитываем все заново (повторяем заново пункты 1-6).
  • Конец алгоритма.
  • 5.3. Задачи и процедуры проверки законов распределений результатов

    Рассмотрим задачу обоснования принятия различных гипотез в тестировании. Есть процедуры, позволяющие отвергнуть проверяемую гипотезу как противоречащую имеющимся данным, либо убедиться в том, что гипотеза этим данным не противоречит.

    Располагая каким-то распределением данных тестирования, можно исследовать возможность описания этой совокупности каким-то типовым распределением, если тип распределения неизвестен, а затем найти неизвестный параметр распределения, а также эффективность описания.

    Наиболее часто рассматриваются гипотезы, в основе которых лежат известные распределения: нормальное (Гаусса), "хи-квадрат" $$(\chi^2)$$, Стьюдента и Фишера. Существуют различные процедуры проверки гипотезы о принадлежности заданного эмпирического распределения к некоторому теоретическому типу.

    Рассмотрим нормальное распределение (распределение Гаусса). Это распределение – наиболее часто встречающееся непрерывное распределение (точнее было бы сказать, что это распределение, к которому "подгоняется" большинство изучаемых распределений). Такому закону или его различным модификациям подчиняются многие наборы случайных величин.

    Общий вид нормального распределения задаётся функцией:

    $$f(x)=\frac{1}{\sqrt{2\pi D(x)}}\exp\left [-\frac{(x-M(x))^2}{2D(x)}\right ].$$

    Здесь М(х) – математическое ожидание рассматриваемой случайной величины х, D(х) - дисперсия.

    Часто используется стандартное нормальное распределение или распределение вероятностей нахождения (попадания) случайной величины в интервал (a;b). Для вычисления значений такой функции используется интеграл (таблица значений этого, не берущегося в квадратурах, интеграла):

    $$\Phi(x)=\int\limits_{-\infty}^x\frac{1}{\sqrt{2\pi}}\exp(-\frac{z^2}{2})dz.$$

    Задача 8. Необходимо на основе имеющихся результатов тестирования проверить гипотезу нормального распределения результатов тестирования, например, достижений (очень простой вариант – в качестве достижения принять среднее арифметическое по всем тестам) тестированных в зависимости от выборки.

    Оценку соответствия рассматриваемого распределения нормальному распределению можно осуществить также и по величине асимметрии:

    $$K=\frac{\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar x)^3}{(\sqrt{\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar x)^2})^3}$$

    Если имеет место левая асимметрия (сдвиг влево кривой распределения), то это говорит о том, что в тесте были облегченные задания, на которые сумели правильно ответить подавляющее большинство испытуемых, а также были усложненные задания, с которыми не смогли справиться подавляющее большинство испытуемых.

    Если имеет место правая асимметрия (сдвиг вправо), то это говорит о том, что в тесте был очень низкий порог трудности для данного контингента испытуемых.

    Алгоритм проверки гипотезы о нормальном законе распределения с помощью коэффициента асимметрии может реализовываться следующими шагами.

  • Вычислить среднее арифметическое $$\bar x$$.
  • Вычислить коэффициент асимметрии К по вышеприведенной формуле.
  • Так как для нормальной кривой распределения характерна симметричность относительно среднего значения, то значение К, равное или достаточно близкое к нулю свидетельствует о симметричности распределения; чем больше значение К, тем больше отклоняется наиболее часто встречающаяся в распределении величина от средней (больше смещена ось симметрии, больше асимметрия кривой), а сдвиг "колоколообразной" части кривой влево или вправо свидетельствует от чрезмерной легкости или сложности заданий.
  • Конец алгоритма.
  • Знание закона распределения баллов необходимо для выработки нормативной шкалы, которая позволит соотнести равные отрезки под кривой распределения равным количествам правильных ответов.

    Распределение можно получить следующей процедурой:

  • Сгенерировать случайную выборку тестируемых (из генеральной совокупности).
  • Протестировать выборку и получить первичные баллы.
  • Оценить баллами каждого испытуемого по отношению к баллам других участников.
  • Найти число интервалов, на которые делится числовая прямая оценок и границы интервалов (например, для четырёхбальной системы оценок находим квартили). Обычно находят балл некоторого испытуемого как процентную долю испытуемых, первичный балл которых ниже первичного балла данного испытуемого.
  • Если распределение не подчиняется нормальному закону, то либо изменяют тесты до тех пор пока не получим нормальное распределение, либо принудительно нормализуют распределение, либо используют шкалы, ориентированные на другие типы распределений.

    Необходимо искусственно приводить распределение первичных тестовых оценок к нормальному виду, так как она наиболее изучена (проста) в математической статистике и дает возможность описывать диагностические нормы в компактной форме.

    Применение известных статистических программных пакетов позволяет автоматизировать подгонку требуемого преобразования первичных тестовых оценок к комбинациям различных базисных аналитических функций, что также позволяет стандартизировать тестовые оценки.

    5.4. Распределения, гипотезы и адаптивное тестирование

    Располагая каким-то распределением данных тестирования, можно исследовать возможность описания этой совокупности каким-то типовым распределением, если тип распределения неизвестен, а затем найти (идентифицировать) неизвестный параметр (параметры) распределения, а также эффективность того или иного описания. Неправильный выбор модели обработки данных тестирования и процедуры тестирования может привести к существенной ошибке в результатах или выводах.

    Технология адаптивного тестирования (методология IRT) опирается на центральную идею: тестовые задания следует адаптировать по трудности к уровню подготовки тестируемой группы – по той или иной заранее определенной технологии. Причем таким образом, чтобы повышать валидность профилей ответов испытуемых. Одинаково не нужны как слишком легкие, так и слишком сложные задания.

    Если адаптационный механизм подобран адекватно, то он должен оптимизировать тест, сократить время тестирования, сохраняя или увеличивая точность измерений (сравнительно с неадаптивным тестированием).

    В итоге, применение адаптивного тестирования предполагает не только генерацию, предъявление и оценку результатов выполненных адаптивных тестов, но и соответствующий анализ данных тестирования, особенно, представление в стандартизованной шкале баллов. Испытуемого, поднимающегося по шкале трудности в рамках тематического блока, "щадят" по трудности заданий в другом блоке, если он удается меньше.

    Адаптивный алгоритм контроля знаний требует оценки статистических признаков и характеристик обучения динамически, на каждом шаге тестирования. Стратегия перехода на новый уровень, а, следовательно, и на новый уровень продуктивности обучения зависит от этого. Методы при тестировании "в глубину" позволяют определить, насколько велик пробел в знаниях обучаемого "в пределах данного распределения данных". Они также увеличивают устойчивость (а также и объективность) оценок трудности заданий, независимость их от свойств выборки, дифференцируемость ошибки измерения для оценок параметров всех испытанных и трудности заданий теста.

    Пример. Можно по имеющимся результатам тестирования получить адекватную эмпирическую формулу зависимости одного фактора y от другого фактора x (например, x – число решенных заданий данной группы, y – граница оценки по заданиям данной группы). Ищем, например, модель типа модели Раша,

    $$p(x,y)=\frac{x}{x+y}=\frac{1}{1+\frac{y}{x}},$$

    или

    $$p(x,y)=\frac{1}{1+z},\quad z=\frac{y}{x},$$

    где p(x,y) – вероятность (мера успеха) того, что испытуемый с мерой уровня подготовки равной x правильно выполнит задание с мерой трудности y.

    По результатам тестирования можно получить эмпирическую формулу зависимости одного фактора y от нескольких других факторов x1 , x2, …, xn (например, x – время, y – средняя оценка тестирования или x – число решенных заданий данной группы, y – граница оценки по заданиям данной группы).

    Пример. Можно найти модель границы оценок $$y=a_1x_1+a_2x_2+a_3x_3$$, где y – номер группы (по уровню подготовки) испытуемого, x1 – число выполненных трудных заданий, x2 – число выполненных средних заданий, x3 – число выполненных легких заданий. Данные yi, x1i, x2i, x3i по испытуемым i=1,2,…,n – заданы. Неизвестные коэффициенты a1, a2, a3 характеризуют веса тестовых баллов заданий каждого уровня при отнесении испытуемых в группу. Такая задача поможет шкалировать данные тестирования. В других случаях ищут квадратичную многофакторную зависимость.

    Дисперсионный анализ позволяет изучать степень влияния одного (нескольких) факторных признаков на результативный признак. Группируя данные наблюдения по интервалам, установить, какая группировка отвечает существенному различию качества отдельных групп тестированных.

    Основная идея такого (дисперсионного) анализа заключается в разбивке суммы квадратов отклонений на несколько компонентов, каждый из которых соответствует действительной, или предполагаемой причине изменчивости средних значений.

    В ходе дисперсионного анализа изучаются колебания лишь одного признака – результативного, а простейшим показателем колебания служит дисперсия, которая разлагается на внутригрупповую и межгрупповую составляющие. Межгрупповая дисперсия возникает под действием какого-либо фактора, который приводит к разным величинам средних, имеющихся в отдельных группах и отражает колебания этих средних. Внутригрупповая дисперсия возникает под действием прочих случайных факторов. Она отражает среднее колебаний внутри групп. При разбиении (разложении) общей дисперсии на две её составляющие, можно выделить ту часть, которая обусловлена действием одного фактора, затем другого, третьего и т.д.

    Общая дисперсия признака – сумма квадратов отклонений всех вариантов результативного признака от общей его средней.

    Пусть производится n измерений случайной величины y. Каждое тестовое измерение yi, i=1, 2, ..., n зависит от некоторого числа параметров xij, которые могут принимать дискретные или непрерывные значения. Эту зависимость представляют обычно в виде линейной комбинации параметров xij с коэффициентами bi и случайными ошибками измерения ei.

    Таким образом, находим некоторую многофакторную зависимость:

    $$y_j=b_0+b_1x_{1j}+b_2x_{2j}+\cdots+b_mx_{mj}+e_j.$$

    Для однофакторного дисперсионного анализа данные представляют в виде:

    $$y_{kj}=b_k+e_{kj},\quad k=1,2,\dots,K;\quad j=1,2,\dots,J_j,$$

    где k – номер уровня (группы), куда попало наблюдаемое значение ykj, K – число уровней, Jj – число попавших в класс номер j, bk – среднее значение по уровню номер k, ekj – ошибка для ykj. Затем находят общее среднее b и групповые средние bk:

    $$b=\frac{\sum_{k=1}^{K}\sum_{j=1}^{J_k}y_{kj}}{J_k},$$ $$b_k=\frac{\sum_{j=1}^{J_k}y_{kj}}{J_j}.$$

    Далее находят дисперсию по факторам Df и общую (остаточную) дисперсию:

    $$D_f=\frac{\sum_{k=1}^{K}(b_k-b)^2}{K-1},$$ $$D=\frac{\sum_{k=1}^{K}\sum_{j=1}^{J_k}(y_{kj}-b_k)^2}{n-K}.$$

    Значение отношения F=Df/D характеризует влияние факторного признака. Чем больше это влияние, тем больше значение F.

    5.5. Какие задачи оценки качества обучения можно решать еще?

    Разумеется, их множество. И они бывают весьма непростые. Но приводим лишь несколько, "просто полезные примеры".

    Пример. Пусть имеется база из N заданий, из которых формируется тест длины n случайной выборкой заданий. Необходимо адаптивно перейти на новый уровень, если обучаемый дал на них m правильных ответов при необходимых для перехода М ответах, оценивая вероятности успешного ответа обучаемых.

    Вероятность того, что обучаемый сможет ответить, равна:

    $$P(n,m)=\frac{C_M^mC_{N-M}^{n-m}}{C_N^n}.$$

    Простая оценка:

    $$S^2(\tau)=\frac{n}{n-1}\left[\frac{1}{n}\sum_{i=1}^{n}\tau^2_i-(\frac{1}{n}\sum_{i=1}^{n}\tau_i)2\right],$$

    где $$\tau=(\tau_1,\tau_2,\dots,\tau_n),\tau_i$$ – время выполнения задания в i–ой попытке, $$\tau$$- вектор теста, n – количество попыток.

    Пример. Разработчик теста разбил тест С на два субтеста А и В (создал две идентичные формы теста Т). Если А и В строго идентичны (параллельны), то коэффициент надежности для любой формы будет $$\rho_{AB}$$. Предположим, что предъявляются обе формы Т и необходимо вычислить общую оценку по каждому испытуемому.

    Составная оценка – это общая оценка, основанная на двух или более оценках по субтестам. Она основана на составной оценке:

    $$C=A+B.$$

    Как определить надежность составных оценок? Разработчику теста следует создать опять две формы субтестов для получения составной оцен-ки. Но какова надежность такой (составной) оценки по четырем субтестам?

    Построить метод выяснения надежности составной оценки по статистическим свойствам ее компонентов можно, используя прогнозную процедуру Спирмана-Брауна, которая позволяет оценить надежность составной оценки по параллельным тестам, если надежность одного из них известна.

    Пример. Необходимо выявить эффективно общую тенденцию в случайных данных, например, выявить степень обученности по результатам, выбираемым случайным образом. Эффективным методом (приемом) выявления общей тенденции динамики в случайных данных является аналитическое выравнивание, используя различные формы зависимости.

    Если динамический ряд уровня знаний соответствует процессу со стабильным абсолютным приростом знаний, то подходящим уравнением будет y(t)=a0+a1t, где a0 и a1 – параметры уравнения, t – время. Параметр a1 (коэффициент углового наклона) определяет направление развития. Если a1>0, то уровни ряда динамики равномерно возрастают, а при a1< 0 – равномерно снижаются. Основная тенденция развития во временных рядах со стабильными темпами прироста отображается квадратичной функцией y(t)=a0+a1t+a2t2. Параметр a2 характеризует постоянное изменение интенсивности развития (в единицу времени). При a2>0 происходит ускорение развития, а при а2<0 – замедление.

    Основная тенденция во временных рядах с постоянными темпами роста отображается показательной функцией y(t)=a0a1t, где а1 – темп роста (снижения) изучаемого явления в единицу времени, т.е. интенсивность развития.

    Темы для самостоятельных работ и рефератов

  • Основные критерии для выбора тестов и тестирования.
  • "Плюсы" и "минусы" методологии СТТ.
  • "Плюсы" и "минусы" методологии GT.
  • "Плюсы" и "минусы" методологии IRT.
  • "Плюсы" и "минусы" методологии E/L.
  • Что такое случайная оценка угадывания, как ее можно оценить?
  • Какова роль распределения данных тестирования в оценке тестирования?
  • Каковы последствия неправильного выбора модели обработки данных тестирования?
  • Каковы последствия неправильного выбора процедуры тестирования?
  • Использование дисперсионного анализа в задачах оценки тестирования.
  • Вернуться к учебному плану