Статистика

Сводка и группировка статистических данных

Показывать лекцию целиком

3.1. Задачи и виды статистической сводки

Статистическая сводка - это первичная обработка данных статистического наблюдения с целью их систематизации. Она предполагает сведение полученной статистической информации о единицах наблюдения в массив данных, упорядоченных по значению какого-либо признака.

По глубине обработки материала различают простую и сложную сводку.

Простая сводка предполагает сведение полученных данных в статистические таблицы, подведение общих итогов по совокупности в целом.

Сложная сводка осуществляется с применением метода группировок по определенной программе, предусматривающей следующие этапы:

  • выбор группировочных признаков;
  • определение порядка формирования групп;
  • разработка системы показателей для характеристики групп и статистической совокупности в целом;
  • разработка макетов статистических таблиц для представления результатов сводки;
  • распределение единиц наблюдения на группы по изучаемым признакам;
  • подведение групповых и общих итогов;
  • оформление результатов сводки в виде статистических таблиц.
  • По технике выполнения различают ручную сводку и сводку с использованием компьютерных технологий.

    По форме обработки статистической информации, собранной в процессе наблюдения, сводка может быть децентрализованной и централизованной. В первом случае данные сначала сводятся по территориям, а затем в центральной организации проводится обработка уже систематизированных данных. Во втором случае вся работа по первичной обработке собранной информации осуществляется в центральной организации.

    Результатом проведения статистической сводки является получение обобщающих статистических таблиц, которые содержат итоговые данные по показателям, характеризующим единицы наблюдения. Этими итоговыми данными могут быть суммарные значения показателей, рассчитанные как для всей совокупности в целом, так и для отдельных групп единиц, если проводилась разбивка на группы; средние значения, относительные показатели.

    3.2. Метод группировок в статистике

    Под статистической группировкой понимается распределение единиц наблюдения по группам по одному или нескольким признакам. Эти признаки называются группировочными. В зависимости от задач исследования строят типологические, структурные и аналитические группировки.

    Типологическая группировка представляет собой распределение единиц наблюдения качественно неоднородной совокупности по социально-экономическим типам, классам, качественно однородным группам. Например, распределение совокупности предприятий по формам собственности (табл. 3.1); отраслям экономики; размеру бизнеса - малые, средние и крупные предприятия (отнесение к ним идет сразу по нескольким критериям); банков - на государственные и коммерческие и т.д. Основная задача типологической группировки - идентификация и описание типов исследуемого явления. Число выделяемых групп определяется количеством типов, классов, однородных групп, т.д. самим характером явления.

    Распределение предприятий и организаций по формам собственности на 1 января 2006 г.
    Форма собственности Число предприятий и организаций, тыс.
    Государственная 160
    Муниципальная 252
    Собственность общественных и религиозных объединений (организаций) 252
    Частная 3 838
    Прочие формы собственности, включая смешанную российскую, иностранную, совместную российскую и иностранную 265
    Всего 4 767

    Источник: Россия в цифрах. 2006: Крат. стат. сб. / Росстат. М., 2006. С. 167.

    При структурной группировке разделение единиц однородной совокупности на группы происходит с целью выявления ее структуры по одному из признаков. Например, распределение наемных работников по полу, возрасту; распределение предприятий по численности работающих и т.д. Примером структурной группировки являются данные табл. 3.2.

    Структура работников по стажу работы на предприятии
    Стаж работы, лет Число работников Число работников в процентах к итогу
    До 2 10 5
    2-4 20 10
    4-6 30 15
    6-8 80 40
    8 и более 60 30
    Итого 200 100

    Важную роль в статистическом анализе играют аналитические группировки. С их помощью определяют наличие связи между признаками и ее направление. При этом один из признаков является результативным, а другой - факторным. Результативный признак меняется под воздействием факторного признака.

    При построении аналитической группировки в качестве группировочного признака всегда выбирают факторный признак. В каждой выделенной группе рассчитывают среднее значение результативного признака. Например, в табл. 3.3 компании сгруппированы по величине затрат на рекламу. В каждой группе определен средний размер товарооборота. Из таблицы видно, что чем больше внимания компании уделяют рекламе, тем значительнее результаты их деятельности, выражающиеся в объеме товарооборота.

    Распределение компаний по затратам на рекламу и объему товарооборота
    Затраты на рекламу в год, млн руб. Число компаний Объем товарооборота в среднем на одну компанию, млн руб.
    До 3 5 300
    3-5 20 305
    5-7 15 315
    7 и более 10 320
    Итого 50 311

    Связь между признаками называется прямой, если с ростом значений факторного признака увеличиваются значения результативного признака. Связь является обратной, если увеличение значений факторного признака приводит к уменьшению значений результативного признака. В нашем примере рост затрат на рекламу вызвал увеличение объемов товарооборота, значит между этими признаками наблюдается прямая связь.

    Наряду с группировками в статистическом анализе используются классификации. Классификация - это общепринятое, традиционно применяемое, часто официально установленное разбиение совокупности на группы, являющееся определенным стандартом, при котором единицам наблюдения предъявляются строгие требования относительно их соответствия той или иной группе. В основе классификаций лежит качественный признак. К наиболее известным относятся классификации отраслей экономики, административно-территориального деления, экономических регионов, видов экономической деятельности и др. Классификации не являются чем-то стабильным, в соответствии с экономическими и политическими изменениями меняются и они.

    В зависимости от количества признаков, по которым проводится группировка, различают простые и сложные группировки. Если группировка проводится по одному признаку, то она называется простой (см. табл. 3.1, 3.2). Если единицы совокупности группируются сразу по двум или более признакам, то такая группировка называется сложной. При этом внутри групп, образованных по одному признаку, единицы совокупности подразделяются на подгруппы по другому признаку. Примером сложной группировки является группировка учащихся на потоке по двум признакам - полу и возрасту. Ее результаты могут быть представлены в виде таблицы (табл. 3.4).

    Распределение учащихся на потоке по полу и возрасту
    Возраст, лет Пол Итого
    мужчины женщины
    До 14 10 8 18
    15 8 9 17
    16 12 13 25
    17 и более 11 10 21
    Итого 41 40 81

    Вторичная группировка данных. На практике часто возникают ситуации, когда по имеющимся сгруппированным данным требуется построить новую группировку. При этом, как правило, массив первичных данных оказывается недоступным. Тогда прибегают к методам вторичной группировки данных.

    Вторичной группировкой называется перегруппировка уже сгруппированных данных без обращения к массиву первичных данных. Для этой цели применяются два подхода: объединение первоначальных интервалов, если границы новых и старых групп совпадают, и долевая перегруппировка данных при несовпадении границ.

    Метод объединения первоначальных интервалов продемонстрируем на следующем примере. Предположим, что исходные данные представляют собой ряд, приведенный в табл. 3.5.

    Распределение работников фирмы по размеру заработной платы
    Номер интервала Заработная плата, руб. Численность работающих, чел.
    1 2 000-3 000 16
    2 3 000-4 000 40
    3 4 000-5 000 65
    4 5 000-6 000 58
    5 6 000-7 000 44
    6 7 000 и выше 17
    Итого - 240

    Перегруппируем данные и образуем новые интервалы: "2000-4000", "4000-6000", "6000 и выше". Поскольку границы новых и старых интервалов совпадают, легко видеть, что в первый новый интервал "2000-4000" попадут работники первого и второго интервалов исходной группировки (16 + 40 = 56 чел.), во второй новый интервал - работники третьего и четвертого интервалов исходной группировки (65 + 58 = 123 чел.), в третий новый интервал - работники двух последних интервалов (44 + 17 = 61 чел.). Результаты перегруппировки представлены в табл. 3.6.

    Распределение работников фирмы по размеру заработной платы (вторичная группировка)
    Номер интервала Заработная плата, руб. Численность работающих, чел.
    1 2 000-4 000 56
    2 4 000-6 000 123
    3 6 000 и выше 61
    Итого - 240

    Долевая перегруппировка базируется на принципе равномерности распределения единиц наблюдения внутри границ интервальных групп. В результате ее проведения рассчитывают, какая часть единиц наблюдения перейдет из старой интервальной группы в новую.

    Пример 3.1. "Перегруппируем данные табл. 3.5 и образуем новые интервалы: "2000-3400"; "3400-4800"; "4800-6200"; "6200 и выше". Распределим единицы совокупности по новым интервалам.

    В первый новый интервал войдут из исходной группировки все единицы первого интервала и часть единиц из второго интервала. Эту часть мы определяем следующим образом. Новая граница "3400" разбивает второй интервал на два отрезка: "3000-3400" и "3400-4000". Находим, какую долю составляет длина отрезка "3000-3400" от длины второго интервала. Она равна Значит, от 40 единиц, находившихся во втором интервале исходной группировки, следует взять для нового первого интервала 16 единиц Тогда первый новый интервал будет содержать 32 единицы (16 + 16).

    Во второй новый интервал войдут оставшиеся от второго интервала исходной группировки 24 единицы (40 - 16) и часть единиц из третьего интервала. Для этого мы находим, какую долю составляет отрезок "4000-4800" от длины третьего интервала "4000-5000". Она равна Значит, от 65 единиц следует взять для второго нового интервала 52 единицы Итак, второй интервал новой группировки будет содержать 76 единиц (24 + 52).

    В третий интервал вторичной группировки войдут оставшиеся 13 единиц (65 - 52 = 13) третьего интервала исходной группировки, все единицы ее четвертого интервала (58 ед.) и 9 единиц пятого интервала

    В последний интервал новой группировки войдут оставшиеся 35 единиц (44 - 9 = 35) пятого интервала и все 17 единиц последнего интервала, т.е. 52 единицы (35 + 17).

    При проверке правильности расчетов видим, что сумма единиц совокупности осталась равной 240.

    Результаты вторичной группировки приведены в следующей таблице.

    Распределение работников фирм по размеру заработной платы
    Номер интервала Заработная плата, руб. Численность работающих, чел.
    1 2 000-3 000 32
    2 3 000-4 800 76
    3 4 800-6 200 80
    4 6 200 и выше 52
    Итого - 240

    3.3. Ряды распределения: виды, правила построения, графическое изображение

    Результаты группировки собранных статистических данных, как правило, представляются в виде рядов распределения. Ряд распределения - это упорядоченное распределение единиц совокупности на группы по изучаемому признаку.

    Ряды распределения делятся на атрибутивные и вариационные, в зависимости от признака, положенного в основу группировки. Если признак качественный, то ряд распределения называется атрибутивным. Примером атрибутивного ряда является распределение предприятий и организаций по формам собственности (см. табл. 3.1).

    Если признак, по которому строится ряд распределения, количественный, то ряд называется вариационным.

    Вариационный ряд распределения всегда состоит из двух частей: вариант и соответствующих им частот (или частостей). Вариантой называется значение, которое может принимать признак у единиц совокупности, частотой - количество единиц наблюдения, обладающих данным значением признака. Сумма частот всегда равна объему совокупности. Иногда вместо частот рассчитывают частости - это частоты, выраженные либо в долях единицы (тогда сумма всех частостей равна 1), либо в процентах к объему совокупности (сумма частостей будет равна 100%).

    Вариационные ряды бывают дискретными и интервальными. У дискретных рядов (табл. 3.7) варианты выражены конкретными числами, чаще всего целыми.

    Распределение работников по времени работы в страховой компании
    Время работы в компании, полных лет (варианты) Число работающих
    Человек (частоты) в % к итогу (частости)
    до года 15 11,6
    1 17 13,2
    2 19 14,7
    3 26 20,2
    4 10 7,8
    5 18 13,9
    6 24 18,6
    Итого 129 100,0

    В интервальных рядах (см. табл. 3.2) значения показателя задаются в виде интервалов. Интервалы имеют две границы: нижнюю и верхнюю. Интервалы могут быть открытыми и закрытыми. У открытых нет одной из границ, так, в табл. 3.2 у первого интервала нет нижней границы, а у последнего - верхней. При построении интервального ряда в зависимости от характера разброса значений признака используют как равные интервальные промежутки, так и неравные (в табл. 3.2 представлен вариационный ряд с равными интервалами).

    Если признак принимает ограниченное число значений, обычно не больше 10, строят дискретные ряды распределения. Если вариант больше, то дискретный ряд теряет свою наглядность; в этом случае целесообразно использовать интервальную форму вариационного ряда. При непрерывной вариации признака, когда его значения в определенных пределах отличаются друг от друга на сколь угодно малую величину, также строят интервальный ряд распределения.

    3.3.1. Построение дискретных вариационных рядов

    Рассмотрим методику построения дискретных вариационных рядов на примере.

    Пример 3.2. Имеются следующие данные о количественном составе 60 семей:

    2 3 3 1 4 2 3 3 1 5 2 4 3 2 2 1 2 3 4 5
    2 2 1 3 4 3 3 3 6 6 3 3 6 1 3 4 3 4 4 5
    3 3 2 2 1 3 2 5 5 2 4 3 6 1 2 2 3 1 3 4

    Для того чтобы получить представление о распределении семей по числу их членов, следует построить вариационный ряд. Поскольку признак принимает ограниченное число целых значений строим дискретный вариационный ряд. Для этого сначала рекомендуется выписать все значения признака (число членов в семье) в порядке возрастания (т.е. провести ранжирование статистических данных):

    1 1 1 1 1 1 1 1 2 2 2 2 2 2 2 2 2 2 2 2
    2 2 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3 3
    3 3 4 4 4 4 4 4 4 4 4 5 5 5 5 5 5 6 6 6

    Затем необходимо подсчитать число семей, имеющих одинаковый состав. Число членов семей (значение варьирующего признака) - это варианты (будем их обозначать через х), число семей, имеющих одинаковый состав, - это частоты (будем их обозначать через f ). Результаты группировки представим в виде следующего дискретного вариационного ряда распределения:

    Число членов семьи (х) Число семей (y)
    1 8
    2 14
    3 20
    4 9
    5 5
    6 4
    Итого 60

    3.3.2. Построение интервальных вариационных рядов

    Покажем методику построения интервальных вариационных рядов распределения на следующем примере.

    Пример 3.3. В результате статистического наблюдения получены следующие данные о средней величине процентной ставки 50 коммерческих банков (%):

    14,7 19,0 24,5 20,8 12,3 24,6 17,0 14,2 19,7 18,8
    18,1 20,5 21,0 20,7 20,4 14,7 25,1 22,7 19,0 19,6
    19,0 18,9 17,4 20,0 13,8 25,6 13,0 19,0 18,7 21,1
    13,3 20,7 15,2 19,9 21,9 16,0 16,9 15,3 21,4 20,4
    12,8 20,8 14,3 18,0 15,1 23,8 18,5 14,4 14,4 21,0

    Как видим, просматривать такой массив данных крайне неудобно, кроме того, не видно закономерностей изменения показателя. Построим интервальный ряд распределения.

  • Определим число интервалов.

    Число интервалов на практике часто задается самим исследователем исходя из задач каждого конкретного наблюдения. Вместе с тем его можно вычислить и математически по формуле Стерджесса

    n = 1 + 3,322lgN,

    где n - число интервалов;

    N - объем совокупности (число единиц наблюдения).

    Для нашего примера получим: n = 1 + 3,322lgN = 1 + 3,322lg50 = 6,6 " 7.

  • Определим величину интервалов (i) по формуле

    где хmax - максимальное значение признака;

    хmin - минимальное значение признака.

    Для нашего примера

    Интервалы вариационного ряда наглядны, если их границы имеют "круглые" значения, поэтому округлим величину интервала 1,9 до 2, а минимальное значение признака 12,3 до 12,0.

  • Определим границы интервалов.

    Интервалы, как правило, записывают таким образом, чтобы верхняя граница одного интервала являлась одновременно нижней границей следующего интервала. Так, для нашего примера получим: 12,0-14,0; 14,0-16,0; 16,0-18,0; 18,0-20,0; 20,0-22,0; 22,0-24,0; 24,0-26,0.

    Подобная запись означает, что признак непрерывный. Если же варианты признака принимают строго определенные значения, например, только целые, но их количество слишком велико для построения дискретного ряда, то можно создать интервальный ряд, где нижняя граница интервала не будет совпадать с верхней границей следующего интервала (это будет означать, что признак дискретный). Например, в распределении работников предприятия по возрасту можно создать следующие интервальные группы лет: 18-25, 26-33, 34-41, 42-49, 50-57, 58-65, 66 и более.

    Кроме того, в нашем примере мы могли бы сделать первый и последний интервалы открытыми, т.д. записать: до 14,0; 24,0 и выше.

  • По исходным данным построим ранжированный ряд. Для этого запишем в порядке возрастания значения, которые принимает признак. Результаты представим в таблице:
    Ранжированный ряд величин процентной ставки коммерческих банков
    Ставка банка % (варианты)
    12,3 17,0 19,9 23,8
    12,8 17,4 20,0 24,5
    13,0 18,0 20,0 24,6
    13,3 18,1 20,4 25,1
    13,8 18,5 20,4 25,6
    14,2 18,7 20,5
    14,3 18,8 20,7
    14,4 18,9 20,7
    14,7 19,0 20,8
    14,7 19,0 21,0
    15,1 19,0 21,0
    15,2 19,0 21,1
    15,3 19,0 21,4
    16,0 19,6 21,9
    16,9 19,7 22,7
  • Подсчитаем частоты.

    При подсчете частот может возникнуть ситуация, когда значение признака попадет на границу какого-либо интервала. В таком случае можно руководствоваться правилом: данная единица приписывается к тому интервалу, для которого ее значение является верхней границей. Так, значение 16,0 в нашем примере будет относиться ко второму интервалу.

  • Результаты группировки, полученные в нашем примере, оформим в таблице.

    Распределение коммерческих банков по величине кредитной ставки
    Краткая ставка, % Количество банков, ед. (частоты) Накопленные частоты
    12,0-14,0 5 5
    14,0-16,0 9 14
    16,0-18,0 4 18
    18,0-20,0 15 33
    20,0-22,0 11 44
    22,0-24,0 2 46
    24,0-26,0 4 50
    Итого 50 -

    В последней графе таблицы представлены накопленные частоты, которые получают путем последовательного суммирования частот, начиная с первой (например, для первого интервала - 5, для второго интервала 5 + 9 = 14, для третьего интервала 5 + 9 + 4 = 18 и т.д. ). Накопленная частота, например, 33, показывает, что у 33 банков кредитная ставка не превышает 20% (верхняя граница соответствующего интервала).

    В процессе группировки данных при построении вариационных рядов иногда используются неравные интервалы. Это относится к тем случаям, когда значения признака подчиняются правилу арифметической или геометрической прогрессии или когда применение формулы Стерджесса приводит к появлению "пустых" интервальных групп, не содержащих ни одной единицы наблюдения. Тогда границы интервалов задаются произвольно самим исследователем исходя из здравого смысла и целей обследования либо по формулам. Так, для данных, изменяющихся в арифметической прогрессии, величина интервалов вычисляется следующим образом:

    ik = ik - 1 + c,

    где ik - величина вычисляемого интервала;

    ik - 1 - величина предыдущего интервала;

    с - константа, на которую происходит увеличение длин интервалов.

    Порядок расчетов границ неравных интервалов для данных, изменяющихся приблизительно в арифметической прогрессии, показан в табл. 3.15.

    Схема интервального вариационного ряда с неравными интервалами для данных, подчиняющихся правилу арифметической прогрессии
    Номер интервала Границы интервала Расчет величины интервала
    1 0-100 100 (величина первого интервала задается исследователем
    2 100-350 100 + 150 = 250 (с = 150 - задается исследователем)
    3 350-750 250 + 150 =400
    4 750-1300 400 + 150 = 550
    5 1 300-2 000 550 + 150 = 700
    6 2 000-2 850 700 + 150 =850

    Для показателей, приблизительно изменяющихся в геометрической прогрессии, величину интервалов можно вычислить по формуле

    ik = ik - 1 #183; c

    где ik - величина вычисляемого интервала;

    ik - 1 - величина предыдущего интервала;

    с - константа-множитель геометрической прогрессии.

    Для графического изображения дискретного вариационного ряда используется полигон распределения: на оси абсцисс откладывают значения вариант, а на оси ординат - соответствующие им частоты или частости, полученные точки соединяют отрезками (образуется ломаная линия). По данным табл. 3.7 построим полигон распределения (рис. 3.1).

    (рис 3.1) Полигон распределения

    Для графического изображения интервального ряда используют гистограмму, имеющую вид многоступенчатой фигуры, состоящей из прямоугольников. По оси абсцисс откладывают значения границ интервалов. Сами интервалы будут являться основаниями прямоугольников. Высота прямоугольников соответствует частоте или частости интервалов, которые откладываются по оси ординат.

    По данным таблицы, приведенной в примере 3.3, построим гистограмму (рис. 3.2).

    При неравных интервалах у гистограммы распределения высотами прямоугольников будут являться показатели плотности распределения, рассчитываемые как частное от деления частоты интервала на его величину.

    Зависимость между значениями признака и накопленными частотами показывают особые графики, называемые кумулятой и огивой распределения.

    Если ряд дискретный, то по оси абсцисс откладывают значения вариант ряда, а по оси ординат - рассчитанные накопленные частоты, получаемые для каждой конкретной варианты как сумма всех предыдущих частот. Полученные точки соединяют ломаной линией. Вместо значений накопленных частот можно взять значения накопленных частостей, тогда верхняя точка на кумулятивной кривой по оси ординат будет соответствовать значению 100%.

    (рис 3.2) Гистограмма распределения

    В случае интервального ряда при построении кумуляты по оси абсцисс отмечают границы интервальных групп, накопленные частоты по оси ординат относят к верхним границам интервалов.

    По данным таблицы, приведенной в примере 3.3, построим кумуляту распределения для интервального ряда (рис. 3.2).

    (рис 3.3) Кумулята распределения

    Если у кумулятивной кривой поменять местами ось абсцисс с осью ординат, получим график, называемый огивой распределения (рис. 3.4).

    (рис 3.4) Огива распределения
    Вернуться к учебному плану