Любое тестирование завершается математико-статистической обработкой данных тестирования и поиском причинно-следственных связей между параметрами тестирования (теста, заданий) результатами тестирования (качеством обучения).
Математико-статистический аппарат и поддерживающий его компьютерный инструментарий для обработки данных полноправно используются в теории педагогических измерений.
Согласно той или иной цели обработки результатов тестирования используют следующие основные методологии (теории):
Российская тестология чаще использует CTT и IRT. В классической теории, работа по оценке качества результатов тестирования по надёжности и валидности называется Item Analysis.
При крупномасштабном тестировании (национального масштаба, например) появляется необходимость в одновременном использовании нескольких методологий.
Пример. При национальном тестировании в США методологию КТТ используют для нахождения типичных коэффициентов надежности, GT – для описания их вариации, IRT – для адаптивного тестирования, а E/L – для получения итоговой оценки учебных достижений по результатам испытаний от поступления обучаемого до окончания им учебного заведения (до итоговой аттестации). Так выявляется динамика личностного развития.
Но основным критерием выбора методологии, математико-статистической теории при обработке результатов тестирования является полезность, информативность получаемых результатов.
Каковы остальные важные критерии для выбора тестов и тестирования?
К ним относятся:
Эти основные критерии и процедуры не исчерпывают имеющееся значительное их количество. В идеале, они должны использоваться итерационно, интегрально, многокритериально и эволюционно.
Компетентностный подход к профессиональному образованию усиливает необходимость такого подхода к оцениванию качества обучения. Особенно, при использовании адаптивного, компьютерного обучения и тестирования.
Пример. В распространенной системе дистанционного обучения Moodle имеются процедуры оценки следующих показателей:
Несмотря на наличие и важность таких оценок, при оценке качества тестов, тестирования должен учитываться и "стар-ап" – уровень подготовки студентов. Педагогические измерения зависят от личности и целевой группы испытуемых, для которых тест разработан.
Такие аспекты качества, как приемлемость гипотезы измерений, цели тестирования (не только метрические, но и педагогические, психологические и др.), представительная группа испытуемых и другие также должны быть учтены. Сами же тестовые баллы – результаты тестирования, которые не всегда можно интерпретировать как результаты качества обучения.
Каждая методология, метод оценки качества имеет свои "плюсы" и "минусы". Как и сама практика оценки знаний.
У последней, видимо, минусов больше (стихийность, нерациональность, не дидактичность, игнорирование особенностей предмета, целевой аудитории и др.).
Рассмотрим некоторые базовые понятия и задачи (алгоритмы) проведения оценивания по любой методологии. Сам класс таких задач – весьма широк.
Задача 1. Пусть даны результаты тестирования группы, состоящей из n испытуемых для заданного теста из m различных знаний. Обычно эти данные представляются в виде некоторой матрицы A баллов размерности n на m:
$$A(n\times m)=\begin{Vmatrix}a_{11}a_{12}\dotsa_{1m}\\a_{21}a_{22}\dotsa_{2m}\\\dots\dots\dots\dots\\a_{n1}a_{n2}\dotsa_{nm}\\\end{Vmatrix}=\|a_{ij}\|_{i=\overline{1,n}}^{j=\overline{1,m}}$$Элемент aij матрицы A представляет собой результат выполнения j-го задания для i-го тестируемого.
Необходимо на основе имеющихся результатов x1, x2, ..., xn тестирования для каждого из n тестированных, вычислить основные статистические показатели тестирования (оценить "сырые" результаты) для выбранной случайным образом группы тестированных.
Алгоритм решения этой задачи состоит из следующих этапов.
Задача 2. Даны результаты тестирования для каждого из n тестированных и теста длины m в виде матрицы A, а также вектор эталонных ответов B=(b1, b2, …, bm), где bj – эталонный ответ на задание номер j. Необходимо определить "вес" (меру сложности) конкретного задания теста.
Простейший алгоритм решения этой задачи состоит из следующих этапов.
Задача 3. Даны результаты тестирования для каждого из n тестированных и теста длины m в виде матрицы A, а также вектор эталонных ответов B=(b1, b2, …, bm), где bj – эталонный ответ на задание номер j. Необходимо оценить валидность каждого задания теста.
Простейший алгоритм решения этой задачи состоит из следующих этапов.
Задача 4. Даны результаты нормативно-ориентированного тестирования для каждого из n тестированных и теста длины m в виде матрицы A, а также вектор эталонных ответов B=(b1, b2, …, bm), где bj – эталонный ответ на задание номер j. Необходимо оценить надежность теста (степень устойчивости результатов тестирования каждого испытуемого, если тестирование было проведено в совершенно одинаковых условиях).
Для вычисления надежности нормативно-ориентированного теста используем коэффициент корреляции между результатами двух параллельных тестов. Сравнивая коэффициенты корреляции, делаем заключение о надежности (внутренней) теста. Если две половины теста коррелированы, то и тест надёжен; в противном случае – не надёжен (или необходимо применить другой, более тонкий математический аппарат исследования надежности).
Простой алгоритм решения этой задачи состоит из следующих этапов.
Задача 5. Необходимо на основе имеющихся результатов тестирования (матрица А) получить для каждого из n тестированных интегральный (обобщенный) показатель выполнения теста длины m, а затем по вычисленным значениям этого интегрального показателя разбить всех тестированных на заданное количество k групп.
Алгоритм решения этой задачи состоит из следующих этапов.
Задача 6. Есть результаты тестирования, полученные в виде матрицы А. Необходимо разбить всех тестированных на несколько групп по отношению к норме (сильные, средние, слабые), где величина x – норма для тестовых результатов и величина k – масштабный коэффициент.
Алгоритм решения задачи.
Задача 7. Необходимо отсеять первичные ("сырые") результаты в группах, т.е. по данным x1, x2, …, xn (процент выполнения, валидность и т.д.) выяснить задания (тесты, результаты), которые не согласуются с общей картиной тестирования.
Алгоритм решения задачи состоит из следующих этапов.
Рассмотрим задачу обоснования принятия различных гипотез в тестировании. Есть процедуры, позволяющие отвергнуть проверяемую гипотезу как противоречащую имеющимся данным, либо убедиться в том, что гипотеза этим данным не противоречит.
Располагая каким-то распределением данных тестирования, можно исследовать возможность описания этой совокупности каким-то типовым распределением, если тип распределения неизвестен, а затем найти неизвестный параметр распределения, а также эффективность описания.
Наиболее часто рассматриваются гипотезы, в основе которых лежат известные распределения: нормальное (Гаусса), "хи-квадрат" $$(\chi^2)$$, Стьюдента и Фишера. Существуют различные процедуры проверки гипотезы о принадлежности заданного эмпирического распределения к некоторому теоретическому типу.
Рассмотрим нормальное распределение (распределение Гаусса). Это распределение – наиболее часто встречающееся непрерывное распределение (точнее было бы сказать, что это распределение, к которому "подгоняется" большинство изучаемых распределений). Такому закону или его различным модификациям подчиняются многие наборы случайных величин.
Общий вид нормального распределения задаётся функцией:
$$f(x)=\frac{1}{\sqrt{2\pi D(x)}}\exp\left [-\frac{(x-M(x))^2}{2D(x)}\right ].$$Здесь М(х) – математическое ожидание рассматриваемой случайной величины х, D(х) - дисперсия.
Часто используется стандартное нормальное распределение или распределение вероятностей нахождения (попадания) случайной величины в интервал (a;b). Для вычисления значений такой функции используется интеграл (таблица значений этого, не берущегося в квадратурах, интеграла):
$$\Phi(x)=\int\limits_{-\infty}^x\frac{1}{\sqrt{2\pi}}\exp(-\frac{z^2}{2})dz.$$Задача 8. Необходимо на основе имеющихся результатов тестирования проверить гипотезу нормального распределения результатов тестирования, например, достижений (очень простой вариант – в качестве достижения принять среднее арифметическое по всем тестам) тестированных в зависимости от выборки.
Оценку соответствия рассматриваемого распределения нормальному распределению можно осуществить также и по величине асимметрии:
$$K=\frac{\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar x)^3}{(\sqrt{\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar x)^2})^3}$$Если имеет место левая асимметрия (сдвиг влево кривой распределения), то это говорит о том, что в тесте были облегченные задания, на которые сумели правильно ответить подавляющее большинство испытуемых, а также были усложненные задания, с которыми не смогли справиться подавляющее большинство испытуемых.
Если имеет место правая асимметрия (сдвиг вправо), то это говорит о том, что в тесте был очень низкий порог трудности для данного контингента испытуемых.
Алгоритм проверки гипотезы о нормальном законе распределения с помощью коэффициента асимметрии может реализовываться следующими шагами.
Знание закона распределения баллов необходимо для выработки нормативной шкалы, которая позволит соотнести равные отрезки под кривой распределения равным количествам правильных ответов.
Распределение можно получить следующей процедурой:
Если распределение не подчиняется нормальному закону, то либо изменяют тесты до тех пор пока не получим нормальное распределение, либо принудительно нормализуют распределение, либо используют шкалы, ориентированные на другие типы распределений.
Необходимо искусственно приводить распределение первичных тестовых оценок к нормальному виду, так как она наиболее изучена (проста) в математической статистике и дает возможность описывать диагностические нормы в компактной форме.
Применение известных статистических программных пакетов позволяет автоматизировать подгонку требуемого преобразования первичных тестовых оценок к комбинациям различных базисных аналитических функций, что также позволяет стандартизировать тестовые оценки.
Располагая каким-то распределением данных тестирования, можно исследовать возможность описания этой совокупности каким-то типовым распределением, если тип распределения неизвестен, а затем найти (идентифицировать) неизвестный параметр (параметры) распределения, а также эффективность того или иного описания. Неправильный выбор модели обработки данных тестирования и процедуры тестирования может привести к существенной ошибке в результатах или выводах.
Технология адаптивного тестирования (методология IRT) опирается на центральную идею: тестовые задания следует адаптировать по трудности к уровню подготовки тестируемой группы – по той или иной заранее определенной технологии. Причем таким образом, чтобы повышать валидность профилей ответов испытуемых. Одинаково не нужны как слишком легкие, так и слишком сложные задания.
Если адаптационный механизм подобран адекватно, то он должен оптимизировать тест, сократить время тестирования, сохраняя или увеличивая точность измерений (сравнительно с неадаптивным тестированием).
В итоге, применение адаптивного тестирования предполагает не только генерацию, предъявление и оценку результатов выполненных адаптивных тестов, но и соответствующий анализ данных тестирования, особенно, представление в стандартизованной шкале баллов. Испытуемого, поднимающегося по шкале трудности в рамках тематического блока, "щадят" по трудности заданий в другом блоке, если он удается меньше.
Адаптивный алгоритм контроля знаний требует оценки статистических признаков и характеристик обучения динамически, на каждом шаге тестирования. Стратегия перехода на новый уровень, а, следовательно, и на новый уровень продуктивности обучения зависит от этого. Методы при тестировании "в глубину" позволяют определить, насколько велик пробел в знаниях обучаемого "в пределах данного распределения данных". Они также увеличивают устойчивость (а также и объективность) оценок трудности заданий, независимость их от свойств выборки, дифференцируемость ошибки измерения для оценок параметров всех испытанных и трудности заданий теста.
Пример. Можно по имеющимся результатам тестирования получить адекватную эмпирическую формулу зависимости одного фактора y от другого фактора x (например, x – число решенных заданий данной группы, y – граница оценки по заданиям данной группы). Ищем, например, модель типа модели Раша,
$$p(x,y)=\frac{x}{x+y}=\frac{1}{1+\frac{y}{x}},$$или
$$p(x,y)=\frac{1}{1+z},\quad z=\frac{y}{x},$$где p(x,y) – вероятность (мера успеха) того, что испытуемый с мерой уровня подготовки равной x правильно выполнит задание с мерой трудности y.
По результатам тестирования можно получить эмпирическую формулу зависимости одного фактора y от нескольких других факторов x1 , x2, …, xn (например, x – время, y – средняя оценка тестирования или x – число решенных заданий данной группы, y – граница оценки по заданиям данной группы).
Пример. Можно найти модель границы оценок $$y=a_1x_1+a_2x_2+a_3x_3$$, где y – номер группы (по уровню подготовки) испытуемого, x1 – число выполненных трудных заданий, x2 – число выполненных средних заданий, x3 – число выполненных легких заданий. Данные yi, x1i, x2i, x3i по испытуемым i=1,2,…,n – заданы. Неизвестные коэффициенты a1, a2, a3 характеризуют веса тестовых баллов заданий каждого уровня при отнесении испытуемых в группу. Такая задача поможет шкалировать данные тестирования. В других случаях ищут квадратичную многофакторную зависимость.
Дисперсионный анализ позволяет изучать степень влияния одного (нескольких) факторных признаков на результативный признак. Группируя данные наблюдения по интервалам, установить, какая группировка отвечает существенному различию качества отдельных групп тестированных.
Основная идея такого (дисперсионного) анализа заключается в разбивке суммы квадратов отклонений на несколько компонентов, каждый из которых соответствует действительной, или предполагаемой причине изменчивости средних значений.
В ходе дисперсионного анализа изучаются колебания лишь одного признака – результативного, а простейшим показателем колебания служит дисперсия, которая разлагается на внутригрупповую и межгрупповую составляющие. Межгрупповая дисперсия возникает под действием какого-либо фактора, который приводит к разным величинам средних, имеющихся в отдельных группах и отражает колебания этих средних. Внутригрупповая дисперсия возникает под действием прочих случайных факторов. Она отражает среднее колебаний внутри групп. При разбиении (разложении) общей дисперсии на две её составляющие, можно выделить ту часть, которая обусловлена действием одного фактора, затем другого, третьего и т.д.
Общая дисперсия признака – сумма квадратов отклонений всех вариантов результативного признака от общей его средней.
Пусть производится n измерений случайной величины y. Каждое тестовое измерение yi, i=1, 2, ..., n зависит от некоторого числа параметров xij, которые могут принимать дискретные или непрерывные значения. Эту зависимость представляют обычно в виде линейной комбинации параметров xij с коэффициентами bi и случайными ошибками измерения ei.
Таким образом, находим некоторую многофакторную зависимость:
$$y_j=b_0+b_1x_{1j}+b_2x_{2j}+\cdots+b_mx_{mj}+e_j.$$Для однофакторного дисперсионного анализа данные представляют в виде:
$$y_{kj}=b_k+e_{kj},\quad k=1,2,\dots,K;\quad j=1,2,\dots,J_j,$$где k – номер уровня (группы), куда попало наблюдаемое значение ykj, K – число уровней, Jj – число попавших в класс номер j, bk – среднее значение по уровню номер k, ekj – ошибка для ykj. Затем находят общее среднее b и групповые средние bk:
$$b=\frac{\sum_{k=1}^{K}\sum_{j=1}^{J_k}y_{kj}}{J_k},$$ $$b_k=\frac{\sum_{j=1}^{J_k}y_{kj}}{J_j}.$$Далее находят дисперсию по факторам Df и общую (остаточную) дисперсию:
$$D_f=\frac{\sum_{k=1}^{K}(b_k-b)^2}{K-1},$$ $$D=\frac{\sum_{k=1}^{K}\sum_{j=1}^{J_k}(y_{kj}-b_k)^2}{n-K}.$$Значение отношения F=Df/D характеризует влияние факторного признака. Чем больше это влияние, тем больше значение F.
Разумеется, их множество. И они бывают весьма непростые. Но приводим лишь несколько, "просто полезные примеры".
Пример. Пусть имеется база из N заданий, из которых формируется тест длины n случайной выборкой заданий. Необходимо адаптивно перейти на новый уровень, если обучаемый дал на них m правильных ответов при необходимых для перехода М ответах, оценивая вероятности успешного ответа обучаемых.
Вероятность того, что обучаемый сможет ответить, равна:
$$P(n,m)=\frac{C_M^mC_{N-M}^{n-m}}{C_N^n}.$$Простая оценка:
$$S^2(\tau)=\frac{n}{n-1}\left[\frac{1}{n}\sum_{i=1}^{n}\tau^2_i-(\frac{1}{n}\sum_{i=1}^{n}\tau_i)2\right],$$где $$\tau=(\tau_1,\tau_2,\dots,\tau_n),\tau_i$$ – время выполнения задания в i–ой попытке, $$\tau$$- вектор теста, n – количество попыток.
Пример. Разработчик теста разбил тест С на два субтеста А и В (создал две идентичные формы теста Т). Если А и В строго идентичны (параллельны), то коэффициент надежности для любой формы будет $$\rho_{AB}$$. Предположим, что предъявляются обе формы Т и необходимо вычислить общую оценку по каждому испытуемому.
Составная оценка – это общая оценка, основанная на двух или более оценках по субтестам. Она основана на составной оценке:
$$C=A+B.$$Как определить надежность составных оценок? Разработчику теста следует создать опять две формы субтестов для получения составной оцен-ки. Но какова надежность такой (составной) оценки по четырем субтестам?
Построить метод выяснения надежности составной оценки по статистическим свойствам ее компонентов можно, используя прогнозную процедуру Спирмана-Брауна, которая позволяет оценить надежность составной оценки по параллельным тестам, если надежность одного из них известна.
Пример. Необходимо выявить эффективно общую тенденцию в случайных данных, например, выявить степень обученности по результатам, выбираемым случайным образом. Эффективным методом (приемом) выявления общей тенденции динамики в случайных данных является аналитическое выравнивание, используя различные формы зависимости.
Если динамический ряд уровня знаний соответствует процессу со стабильным абсолютным приростом знаний, то подходящим уравнением будет y(t)=a0+a1t, где a0 и a1 – параметры уравнения, t – время. Параметр a1 (коэффициент углового наклона) определяет направление развития. Если a1>0, то уровни ряда динамики равномерно возрастают, а при a1< 0 – равномерно снижаются. Основная тенденция развития во временных рядах со стабильными темпами прироста отображается квадратичной функцией y(t)=a0+a1t+a2t2. Параметр a2 характеризует постоянное изменение интенсивности развития (в единицу времени). При a2>0 происходит ускорение развития, а при а2<0 – замедление.
Основная тенденция во временных рядах с постоянными темпами роста отображается показательной функцией y(t)=a0a1t, где а1 – темп роста (снижения) изучаемого явления в единицу времени, т.е. интенсивность развития.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.