Современная тестология признает, что качество тестирования зависит от многих параметров, но основой фактор – качество разработки тестов, их валидность. Для повышения качества тест-материалов, начиная с этапа их проектирования и разработки, уже используется экспертиза.
Тестовые задания, удовлетворяющие "внешним" формальным требованиям (правильность формулировки, логическая непротиворечивость, адекватная форма и др.) не являются всегда качественными, позволяющими рассматривать такие задания априори или апостериори как эффективное средство оценки уровня подготовки обучаемых.
Тестовые задания (тесты) измеряют свойства тех или иных выборок потенциальных испытуемых. Экспертиза качества заданий и всего теста – это оценка не только каждого его элемента (дистракторы, их количество и др.), но и всего теста, его структуры, взаимоотношений с другими заданиями.
Качество профессионального образования – это и уровень, объем знаний, их системность, устойчивость, ценность, перспективность, фундаментальность, способность получать и строить новые знания, применять их для решения задач. Эффективное управление качеством образования также невозможно без релевантной и оперативной информации об уровне обученности. Необходимо применение качественных тестовых материалов, достоверно оценивающих учебные достижения.
Применение принципов и средств квалиметрии, системного анализа акцентирует на целостность, эмерджентность, совместимость, адаптивность и другие системные признаки тестов. Качество тестов оценивают мерой соответствия характеристик тестовых заданий и составленных на их основе вариантов тестов. Комплексной оценкой теста (испытания) в целом.
У тестовых заданий, всего теста есть структурные элементы, характеризуемые внутренними и внешними свойствами, своей структурой. На эти свойства влияют определяющим образом много факторов:
Полный учет свойств позволяет сконструировать "желаемые" тесты – тесты с наперед задаваемыми (согласно гипотезе тестирования) качествами, статистическими свойствами, например, "параллельные" тесты, субтесты и др. Нужно учитывать также меру дифференциации, способность заданий (тестов) дифференцировать тестируемых, например, способность дифференцировать относительно максимального или минимального уровня обучения.
Первостепенно важны для анализа такие характеристики, как трудность (сложность) задания и его различающая способность. Трудность задания отражает уровень ее выполнимости в данной статистической выборке (стандартной). Ее оценивают часто отношением количества правильно выполнивших задание к количеству выборки испытуемых.
Чем ближе этот показатель к 1, тем выше трудность задания, чем ближе к 0 – тем ниже его трудность.
В качестве показателя трудности задания теста используют индекс трудности U вычисляемый по формуле:
$$U=100(1-n/N)(\%),$$где n – количество правильно ответивших на задание, N – общее количество испытуемых (выборки).
При построении критериально-ориентированного теста, для повышения его трудности добавляют задания более высокой трудности, для понижения – включают больше заданий низкой трудности.
Трудность задания (теста) бывает:
Трудность – относительная величина, зависящая от возрастных, профессиональных и иных различий испытуемых, поэтому эти особенности влияют на результаты тестирования, на надежность теста. Необходимы меры выравнивания условий (минимизации таких воздействия на тестируемых). Для этого используют направленное комплектование выборки, стандартизацию процедуры тестирования, т.е. необходима эффективная диагностическая методика, приводящая к "золотой середине", балансу трудных, среднего уровня и простых заданий.
Слишком трудные задания ухудшают статистические характеристики оценивания (мало решающих, неудача на трудном задании может повлиять на решение других заданий и т.п.). Слишком простые задания ведут к малоинформативным однообразным результатам, затрудняющим анализ качества обучения, вызывают негативное отношение испытуемых к тесту и тестированию.
Пример. Критериально-ориентированный тест должен быть полным, отражающим по содержанию весь объем знаний, планируемый к усвоению. Нормативно-ориентированный тест может содержать лишь те разделы, которые требуются для дифференциации по уровню учебных достижений обучаемых, например, 50-70% заданий средней трудности (рис. 4.1, рис. 4.2).
В критериально-ориентированных аттестационных тестах основная часть заданий легче, что ограничивает процент неаттестованных студентов.
Пример. Если прогнозный процент неаттестованных должен быть не больше 10%, а критерий "неуспеваемости" – 70% (выполнившие лишь до 30% заданий – не аттестованы), в тест следует включить от 70% легких заданий, посильных 90% тестируемых (рис. 4.2).
(рис 4.1) Распределение заданий в нормативно-ориентированном тесте (по работе: В.И. Звонников, М.Б. Челышкова. Современные средства оценивания результатов обучения. М.: Академия, 2007).
(рис 4.2) Распределение заданий в критериально-ориентированном тесте (там же)
Поэтому важно выбрать тест, оптимальный по сложности заданий, группам сложности, структуре теста. Если на вопрос правильно отвечает большинство испытуемых, его обычно помещают в начале теста, а остальные вопросы – по мере роста их трудности. Такое расположение заданий позволяет оценить приблизительно порог трудности для каждого испытуемого, его место в рейтинге.
Практическое тестирование свидетельствует: максимально отражается индивидуальный уровень знаний, навыков, умений испытуемых при использовании заданий средней трудности с включением небольшого количества остальных заданий.
Есть специальная характеристика, называемая различающей способностью заданий. Она показывает меру эффективности различения тестируемых на группы: овладевшие учебным материалом и не овладевшие им.
Возможна и промежуточная группа. От значения данной характеристики сильно зависит валидность теста.
Определяется различающая способность задания на пилотном тестировании и для него потребуются две серии измерений: а) повторное тестирование; б) тестирование на разных выборках.
Меру различения (различающую способность) R можно в самом простом выражении определить по формуле:
$$R=n/N-m/M,$$где N, M – количество испытуемых, попавших, соответственно, в "высокую" и "низкую" контрастные группы, а n, m – верно ответивших, соответственно, на задание из "высокой" и "низкой" группы.
Чем ближе R к значению +1, тем больше различающая способность задания.
Чем ближе R к нулю, тем меньше различение заданием испытуемых, овладевших или не овладевших учебным материалом.
Чем ближе R к значению –1, тем также больше различение, но в инверсном порядке: испытуемые, овладевшие материалом, ответили неправильно, и наоборот. Это редкий случай, он свидетельствует, например, о пробелах в методике, спонтанности ее.
При комплексном оценивании качества тестового испытания (тестирования) проводится оценка:
Комплексная экспертиза качества тестовых материалов (например, КИМ ЕГЭ) состоит из следующих основных этапов (см. рис. 4.3):
(рис 4.3) Этапы комплексной экспертизы качества тестовых измерителей (ТИ). (по работе: Пермяков О.Е., Максимова О.А. Процедуры комплексной экспертизы качества тестовых заданий и тестов при формировании банка данных, http://jurnal.org/articles/2008/ped14.html)
Предварительная экспертиза состоит из оценивания:
Экспертное оценивание качества материалов – четырехэтапное. Первый этап включает анализ (оценку):
Второй этап включает прогноз успешности выполнения тестового задания в различной степени подготовленными обучающимися, формирование нормативов выполнения задания (теста). Включает:
Третий этап – анализ, оценивание всего теста по критериям, включает оценку:
Четвертый этап – оформление экспертных оценок, суждений, рекомендаций по модификации и доработке задания. Результаты экспертизы представляются (протоколируются) строго, формализовано (в баллах, в выбранной шкале), доступно и понятно как экспертам, так и тестологам, с оценкой пригодности теста для испытаний, обучения.
Для комплексной экспертизы заданий (тестов) необходимо проведение апробационного тестирования на репрезентативных выборках. После такого тестирования последовательно осуществляется:
Параллельный тест – это вариант, имеющий аналогичное содержание (согласно учебной единице), равные значения статистики (средние арифметические, дисперсии и парные корреляции).
Простой способ его использования: нечетные номера заданий – первая половина теста, четные – вторая.
Заключительный этап экспертизы – формирование самой комплексной оценки качества теста (задания). Реализуется этап с помощью процедур:
Классическая тестология долго рассматривала лишь эмпирические показатели трудности. Сейчас много внимания уделяется и характеру умственной деятельности тестируемых.
Актуальна разработка методик, моделей оценивания:
Способности тестов и КИМ являться эффективным средством оценки уровня подготовки обучаемых, при использовании компьютерных и адаптивных систем тестирования актуализируются сильно, так как появляются расширенные возможности для оперативного и динамичного накопления и обработки результатов такого тестирования. Это важно также для формализации и алгоритмизации такого оценивания.
Требования к тестам (тестовым заданиям), методикам и технологиям компьютерного тестирования (коротко, "Требования") должны обеспечить не только качественное тестирование, но объективность оценок его результатов, возможность оценивания степени обученности согласно российским и международным стандартам образования.
Аттестация и аккредитация образовательных учреждений производится по компьютерным тестам, утверждаемым соответствующими УМО и имеющим возможности (для УМО) актуализировать, выбирать, дополнять и совершенствовать представительную базу тестовых заданий (тестов) и технологий тестирования, в зависимости от специфики и возможностей образовательных учреждений.
Базовые требования к содержанию тестов – их соответствие ГОС (содержанию, целям, структуре) и компьютерным технологиям тестирования (возможностям, безопасности, обеспечению), а также использованию веб-технологии и мультимедиа.
Обеспечивается преемственность тестов, их прагматичность и корректность, опора на необходимый объем остаточных знаний. Если строго и полно, то и учет методики обучения, так как в зависимости от нее изменяются и остаточные знания (для традиционной лекции – меньше, для мультимедийной – больше "сухого остатка", т.е. структурированного остаточного знания).
Базы тестовых заданий должны содержать все атрибуты, необходимые для компьютерной актуализации заданий:
Пример. Важными примерами могут служить банки КИМ ЕГЭ, ФЭПО (Федерального экзамена в области высшего профессионального образования), АСТ (Адаптивной среды тестирования) и др.
База проходит экспериментальную проверку, определяются показатели валидности, критерии и показатели оценивания, которые фиксируются в документации к базе.
Процесс тестирования должен обеспечивать (кроме дружественности интерфейса к испытуемому, регулируемости им темпа тестирования и возврата к пропущенным заданиям) регистрацию результатов, протоколирование заключений испытуемых, оценку достижений испытуемого по результатам пройденного тестирования, автоматическое нахождение результата тестирования и его шкалирование.
Госкомиссии должны проводить компьютерное тестирование лишь только в соответствии с Требованиями, по базе. Контроль за соблюдением Требований осуществляет региональный Центр тестирования профессионального образования.
Особая роль отводится персоналу, проводящему тестирование. Методисты-тестологи должны владеть основными знаниями в области:
Методисты-тестологи должны уметь:
Методисты-тестологи должны владеть:
Идет развитие компьютерного и веб-тестирования, а также облачных вычислений и средств тестирования и оценки его результатов.
Пример. Такими системами являются "Школьный мониторинг", "TestEdit 2.1", "AnyTest", "УСАТИК 2.000", "TESTOR.RU", "TESTER" и другие.
Появление развитых систем стимулирует и формирование методологии тестовой квалиметрии, появление новых методик и алгоритмов экспертизы качества тестовых материалов и оценочных средств.
Идеальная система тестирования – саморазвивающаяся. Она структурно и содержательно гибко адаптируется к потребностям образовательной системы и окружающей среды. Переход к открытым и дистанционным формам приводит к новым формам и методам, новым мероприятиям и технологиям, новому интерфейсу и контенту.
Пример. Рабочая программа ЕС (FP7, 2009–2010) по информационным и коммуникационным технологиям считает, что адаптивные обучающие и тестирующие системы – инновационные решения, способные к самонастройке (самоорганизации) в ответ на действия системы и ожидает разработки и исследования концептуальной модели, использующей инновационные подходы, искусственный интеллект, моделирование, педагогика сотрудничества, компетентностный подход.
Во время экспертизы тестовые материалы оцениваются на соответствие критериям (показателям) качества.
Экспертиза качества тестовых материалов – обязательный этап тестирования (в широком смысле). Необходим комплексный подход к экспертизе на основе системного анализа и квалиметрии.
Эксперт должен внимательно ознакомиться со спецификацией теста, провести анализ содержания теста, в основном, ориентируясь на образ тестируемого, имеющего средний уровень подготовки. Эта работа направлена, в основном, на выявление неудачных заданий, их доработку в плане содержания и включает оценивание:
Эксперт выполняет анализ качества содержания теста, используя параллельные варианты, объединяя и обобщая информацию по всей такой группе вариантов. В этом случае оценивание качества вариантов тестов выполняется по критериям:
После этого эксперт делает выводы и рекомендации по улучшению содержания теста.
Пример. В ФИПИ разработали модель экспертизы качества КИМ ЕГЭ. Она включает, в частности, содержательную экспертизу тестовых заданий в отдельности, экспертизу собранных вариантов и тестологическую экспертизу. В течение ряда лет сформирован предварительный банк заданий (разработаны в рамках целевого заказа или всероссийского конкурса по разработке элементов и КИМ базы заданий ЕГЭ). Затем задания оценивали два эксперта – на предмет содержательной валидности. При рассогласованности мнений двух экспертов приглашался третий (все они – специалисты-методисты, члены предметной комиссии). Далее формируются варианты КИМ, которые затем проходят внутреннюю содержательную экспертизу и, в случае отсутствия замечаний к содержанию, отправляются на внешнюю экспертизу, которая проводится также двумя экспертами. По их заключению вносятся необходимая коррекция, совершенствуется КИМ. После этого проводится вторая внешняя экспертиза. Проводится и тестологическая экспертиза КИМ по итогам тестирования (для обеспечения качества отдельных заданий и вариантов, соответствия вариантов спецификации и параллельности всех вариантов). Итак, каждое задание (каждый вариант) проходит 8 уровней экспертизы и доработки (сборка вариантов; внутренняя экспертиза; тестологическая экспертиза; первая внешняя экспертиза; вторая тестологическая экспертиза; вторая внешняя экспертиза; замечания редактора и корректора; проверка ответов и подготовка оригинал-макетов).
Кроме многих достоинств, есть и недостатки экспертной оценки качества тестов, в частности, "за бортом" часто остаются оценки внутрисистемных отношений тестовых заданий в тесте, недостаточно эффективно апробационное тестирование (оно больше "ознакомительное"), не учитывается компетентность и согласованность мнений экспертов в группе.
Последнему "минусу" экспертной оценки посвятим данный пункт. При оценке учебных достижений обучающихся необходимо бывает провести мониторинг (успеваемости, усвоения, хода обучающего процесса и т.д.). Но такой мониторинг и сложный, и дорогостоящий. Поэтому на практике, в частности, при ситуационном тестировании полезны простые и технологичные процедуры, которые позволили бы обходиться без сложного мониторинга (или же минимизировали бы его необходимость, использование).
Рассмотрим один подход, основанный на общих статистических гипотезах.
Есть различные эксперты, экспертные группы, оценивающие среду тестирования. Они дали свои оценки по тестированию, например, по обученности.
Эффективны и объективны здесь методы: метод комиссии, метод Дельфи, метод суда, метод мозговой атаки. Например, метод комиссии начинается с открытой дискуссии экспертов по рассматриваемой проблеме. Коллективное мнение определяется открытым или тайным голосованием. Затем происходит обоснование мнений экспертов и вырабатывается приемлемое мнение экспертной группы.
Улучшить качество прогноза можно, если использовать процедуры формирования различных экспертных групп, процедуры оценивания качества (согласованности, точности) таких экспертных оценок. Согласованность экспертов можно оценить на основе коэффициентов ранговой корреляции, а также конкордации по Спирмэну.
Коэффициент ранговой корреляции оценивает, какой из альтернатив эксперт дал предпочтение. Коэффициент конкордации оценивает согласованность ранжирований членов рассматриваемой экспертной группы.
Если n - число ранжируемых альтернатив, m - число экспертов в группе, то характеристика согласованности экспертной группы даст коэффициент конкордации:
$$W=\left(\frac{12S}{m^2(n^3-n)}\right),$$ $$S=\sum_{i=1}^n(r_i^{(k)}-r_i^{(l)})^2,$$где $$r_{i}^{(k)},r_{i}^{(l)}$$– ранги выбора i, соответственно, в ранжированиях с номерами k и l.
Если W=1, то мнения экспертов полностью совпадают (экспертная группа полностью согласована), если же W=0, – то мнения экспертов полностью несогласованные. В остальных случаях: 0<W<1. Этот критерий нельзя абсолютизировать.
Данный критерий нельзя абсолютизировать, но он вполне практически применим, особенно, при адаптивном тестировании и обучении.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.