Способы проверки процедуры первичного измерения на надежность.
.Способы проверки процедуры первичного измерения на надежность.
Следует иметь в виду, что операции повышения надежности первичного измерения, которые мы будем здесь рассматривать, используются лишь на стадии отработки инструмента измерения в процессе пилотажа. После окончательной проверки надежности построенных шкал и сбора данных на объектах исследования акцент контроля их достоверности переносится с первичного измерения на вторичные, т. е. комбинаторные процедуры, и так последовательно вплоть до обоснования достоверности итоговых выводов.
В целом же достоверность результатов исследования зависит от многих составляющих, начиная с того, насколько обоснована его общая концепция и все компоненты теоретико-методологического раздела программы, а далее — от качества исходных данных, системы их отбора, т. е. соответствия типа выборки (и ее организации) целям исследования, качества анализа данных и, наконец, от глубины интерпретации полученных зависимостей и связей.4
4 О требованиях и операциях, необходимых для гарантии общей Достоверности данных, см. [68, 200, 233]. Если учесть все возможные ошибки, связанные с неполным соответствием теоретической модели объекта самому объекту, возможными упущениями на разных этапах исследования (например, при расчетах выборки, тиражирования полевых документов и т. д.), спецификой типов возможных ошибок (напри-Мер, систематические или случайные), а также некоторые другие причины, то, как показал Б. 3. Докторов [68], в так называемой метрологической карте можно обнаружить 162 (I) составляющие возможных ошибок.
К сожалению, нет единообразия в толковании термина "надежность" применительно к социологической информации. Главная причина состоит в том, что одни авторы трактуют надежность слишком расширительно как качество всего исследования и, следовательно, его итогов, а другие, напротив, отождествляют надежность с тем или иным особым ее проявлением (например, с.устойчивостью данных, их адекватностью целям исследования и т. д.).
Не останавливаясь здесь на дискуссии терминологического характера, заметим, что в строгом смысле слова понятие надежности измерения правомерно относить именно к инструменту, с помощью которого производится измерение, но не к самим данным, подлежащим измерению, В отношении данных, как и заключительных выводов из исследования, правильнее говорить, что они достоверны (или относительно достоверны) в том числе и потому, что фиксированы надежным инструментом.
Возможны различные типологии приемов оценки надежности первичной информации, например, с точки зрения внешнего или внутреннего контроля данных, получаемых определенным способом. Мы будем пользоваться обобщающим понятием надежности инструмента измерения (и соответственно надежности данных, фиксируемых этим инструментом), имея в виду три составляющие: (1) обоснованность, (2) устойчивость и (3) правильность измерения. Естественно, что и методы контроля на надежность нужно рассматривать в этих трех аспектах5.
5 Наиболее детально методы и техника контроля данных на надежность изложены в работах Г. И. Саганенко [233] и В. И. Папиотто [200]. Последний применяет аналитический подход к предмету, выделяя множество разновидностей надежности и технических приемов оценки ее уровня [200. С. 74—75], тогда как Саганоцко, ряд идей и примеров из книги которой мы используем, акцентирует внимание на наиболее существенных, непременных требованиях и сравнительно простых способах контроля надежности.
Обоснованность6 шкалы заключается в том, что с ее помощью целенаправленно измеряют вполне определенное свойство или признак, не смешивая его с другими.
6 В зарубежной и отечественной (особенно в психологической) литературе вместо термина "обоснованность" часто используется как его аналог понятие "валидность". Однако в английском "reliability" (обоснованность) подчеркивает возможность полагаться на кого-либо, в данном случае доверять полученной информации благодаря тому, что она адекватна объекту измерения [337. С, 132—138], a "validity" семантически имеет оттенок устойчивости, "прочности" полученной информации. Поэтому термин "валидность" правильнее было бы соотносить ве с обоснованностью, во с устойчивостью данных измерения.
Предположим, при опросе телезрителей им предлагают указать, каким из перечисленных в прилагаемом списке передачам телевидение уделяет "слишком много", "достаточно" и "слишком мало" времени. Если с помощью этой трехчленной шкалы исследователь намерен фиксировать среднее время, отводимое телепередачам, его измерение будет необоснованным. В действительности он измеряет отношение людей к данным передачам, а не объем времени, отводимого для их трансляции. Обоснованное измерение объема времени на передачи разного типа — документальный анализ "сетки" программ телевидения.
Чтобы повысить обоснованность измерения, используют ряд технических приемов.
(1) Наиболее простой способ — логические рассуждения на основе опыта и здравого смысла.
Обратимся к примеру из обследования, проведенного Б. М. Фирсовым. Задача: определить среднюю интенсивность просмотра телепередач путем массового опроса телезрителей.
Первый вариант построения шкалы был таков. Вопрос: "Сколько приблизительно часов в день Вы проводите у телевизора?" Шкала для ответа содержала пять интервалов: (не больше 1 часа) — (от 1 до 2 часов) — (от 2 до 3 часов) — (от 3 до 4 часов) — (свыше 4 часов).
Путем логических рассуждений были высказаны следующие сомнения в обоснованности такого метода. Следует указать день просмотра телепередач: будний, субботний или воскресный. Иначе неясно, какой из дней зритель выберет за эталон оценки. Не спасет положения и вопрос, сколько в среднем часов в неделю зритель проводит у телевизора, так как люди не привыкли думать в "средних" величинах.
Значит, надо поставить вопрос так, чтобы: а) выделить дни недели и б) указать понятный для зрителя эталон оценки. Поэтому более удачный вариант построения шкалы для решения той же задачи следующий [274. С. 142].
Первый вопрос: "Сколько дней в неделю Вы, как правило, смотрите телевизионные передачи?":
1) почти все дни недели;
2) 3 или 4 дня в неделю;
3) 1 или 2 дня в неделю;
4) меньше, чем один раз в педелю, т. е. не каждую неделю;
5) в сущности, совсем не смотрю.
Второй вопрос: "Не могли бы Вы приблизительно оценить, сколько в среднем часов Вы проводите у телевизора в тот день, когда смотрите передачи?" Сделайте отметку в каждой строке.
Дни недели |
Время просмотра |
||||
|
не больше 1 часа |
от 1 до 2 часов |
от 2 до 3 часов |
от 3 до 4 часов |
свыше 4 часов |
В будние дни |
— |
— |
— |
— |
— |
В субботу |
— |
— |
— |
— |
_ |
В воскресенье |
_ |
- |
— |
— |
— |
Теперь, пользуясь простыми арифметическими действиями, можно рассчитать "среднепросмотровое" время за неделю и составить шкалу.
Обозначим а число дней в неделю, уделяемых просмотру телепередач. Числовые индикаторы ответов на первый вопрос взяты как средние эмпирически полученных интервалов (в числе дней просмотра), а именно: 6; 3,5; 1,5; 0,7; 0. Обозначим Ъ количество часов, затраченных на просмотр телепрограмм в определенные дни (ответы на второй вопрос) также по средним: 4,5; 3,5; 2,5; 1,5; 1.
Обозначив будние дни как d, субботние s, воскресные w, рассчитаем среднепросмотровое время за неделю Т:
Для телезрителя, который в ответе на первый вопрос пометил "3 или 4 раза в неделю", в ответе на второй указал "до 1 часа в будни" и "от 2 до 3 часов в субботу и воскресенье" среднепросмотровое время исчисляется по формуле:
Неадекватное понимание того, что же мы измеряем, может привести к серьезным последствиям. Поучительный пример: дискуссия в прессе относительно добросовестности служб общественного мнения в опросах о рейтинге политических деятелей.
В ноябре 1997 г. два ведущих российских центра изучения общественного мнения представили данные общероссийских опросов. Рейтинги Президента, премьера и некоторых других ключевых фигур в правительстве по опросам центра "А" на 10—12% отличались от рейтингов по опросам службы "Б". Это вызвало публичный скандал: одна служба подыгрывает правительству, а другая — оппозиции. Что же в действительности случилось? Служба "А" задавала вопрос "Одобряете ли Вы деятельность..?", а служба "Б" предлагала формулировку "Доверяете ли Вы..?". На протяжении трех месяцев все показатели доверия/недоверия на 10—12% уступали показателям одобрения/неодобрения, причем этот разрыв устойчиво сохранялся в отношении Президента и премьера, но сильно колебался в отношении ряда других правительственных чиновников (т. е. граждане сформировали позицию относительно Президента и премьера, но не имели четкой позиции в отношении Других, неключевых фигур в правительстве). Через две недели после этого скандала служба "Б" в общероссийском опросе предложила респондентам обе формулировки в одном интервью. Обнаружилось, что доверяют правительству 14-16% опрошенных, но одобряют его деятельность в той же выборке 29%. Логика здесь такая: "Я могу не очень доверять искренности намерений правительства, но то, что оно делает, я склонен сейчас одобрить".
Заметим, однако, что логические рассуждения, наподобие приведенных выше, повышают обоснованность, но не являются прямым доказательством того, что мы меряем искомое свойство.
(2) Тест по "эталонной грynne" - более сильный прием проверки инструмента на обоснованность. Смысл проверки — в сопоставлении данных, полученных путем измерения по шкале, с достоверными сведениями об объекте измерения.
Так, шкала на отношение к соблюдению норм права может быть обоснована опросом осужденных правонарушителей (они рассматриваются как "эталон" негативного полюса шкалы), в сравнении с "эталонной" группой законопослушных граждан. Дихотомизация полярных групп по шкале должна созпадать с фактической поляризацией эталонных групп в пределах допустимой ошибки, величина которой зависит от задач исследования.
(3) Поиск независимого критерия как разновидность внешнего контроля надежности для измерения того же самого объекта или свойства.
Если подключить к телевизионному приемнику прибор, регистрирующий время его работы, и сопоставить показания прибора с результатами опроса о частоте и длительности просмотра телепрограмм, можно точно установить обоснованность данных опроса.
Не имея такой возможности, Б. М. Фирсов сопоставлял сведения, полученные по шкале среднепросмотрового времени, с данными по другой шкале, названной "изменение привычек" (табл. 1) [274, С, 107]. Последняя конструировалась по ответам на вопрос: "Придется ли Вам в случае длительного отсутствия телевизора менять свои привычки, способ проведения досуга, жизненный уклад?" Берем два крайних варианта ответов по второй шкале, отбрасывая промежуточные (в процентах к численности представителей каждого типа, т. е. по строке). Очевидно, что шкала "увлеченности", полученная как вторичная группировка данных среднепросмотрового времени Т, высоко согласуется со шкалой "привычек" и, следовательно, может считаться вполне обоснованной.7
7 Пользуясь той же шкалой, автор провел повторное сравнительное исследование аналогичной выборки ленинградцев спустя 10 и 12 лет. За период с 1967 г. по 1979 г. обнаружилось, что доля "весьма умеренных" телезрителей упала с 32% до 6% и "весьма увлеченных" повысилась с 16% до 40% [157. С. 701].
Таблица 1
Обоснование шкалы увлеченности телевидением по независимому критерию.
Шкала "увлеченности" по средне-просмотровому времени в неделю
|
Шкала "изменения привычек" |
|
"Думаю, что придется изменить привычки" |
"В моей жизни ничего не изменится" + "Вряд ли что изменится в моей жизни" |
|
T1 — "Весьма умеренные" (до 3 ч.) |
15,8 |
11,7+34,4-46,1 |
T2 — "Умеренные" (от 3 до 10 ч.) |
36,1 |
6,0+31,3-37,3 |
Т3 — "Увлеченные" (от 10 до 15 ч.) |
48,7 |
5,5+22,9=28,4 |
Т4 — "Весьма увлеченные" (от 15 до 17 ч.) |
60,0 |
1,6+17,0-18,6 |
(4) Использование метода судей для отбора пунктов шкалы. Сомнения в обоснованности возникают уже на стадии первоначального отбора пунктов шкалы. В каких единицах считать время просмотра телепередач? В днях, часах, в частоте просмотров? Какие понятия выбрать для построения шкалы?
Эти вопросы лучше всего доверить решению компетентных судей. В нашем случае ими являются типичные телезрители» которые будут представлять как бы микромодель основной массы опрашиваемых. В этом смысле "судейство" как способ контроля обоснованности шкалы надо отличать от опроса экспертов — профессиональных специалистов в данной области.
Численность судей зависит от меры однородности или разнородности выборочной совокупности основного обследования. Так, при построении шкал на отношение к досуговым занятиям мнения мужчин и женщин об одних и тех же занятиях будут существенно разными. Рекомендуется отобрать для судейства половину судей из женщин, половину — из мужчин. Не меньшее значение в данном случае будут иметь уровень образования и род занятий. Для компоновки судейской группы используют метод квоты, т. е. устанавливают пропорции судей по набору существенных признаков, включая, например, пол, возраст, образование, выражающих позиции разных групп респондентов в предполагаемой выборке.8
О квотировании выборки см. на с. 349.
(5) Один из широко используемых приемов внутреннего контроля обоснованности — совмещение нескольких показателей для регистрации определенного одного свойства, или построение индекса. Типы индексов крайне разнообразны. Они широко используются в психологических тестах, в социально-экономических исследованиях. Суть индексной обоснованности в том, что, согласно гипотезе, данному свойству находится множество его проявлений, для каждого из которых формируют отдельную шкалу. Затем измерения по частным шкалам либо суммируются, либо из них образуют логические конструкции, как это было сделано в показателе "логический квадрат" для построения производной шкалы удовлетворенности работой (см. с. 261).
Вполне справедливо выделяют два существенно разных аспекта обоснованности: теоретический и эмпирический. Первый непосредственно связан с содержательными посылками исследования и предполагает установление значимых связей с широким классом ситуаций, предсказываемых теорией, второй требует доказательства надежной регистрации данных в сравнительно узком секторе, в частном проявлении изучаемых объектов. "Если валидность (синоним обоснованности. — Е.Я.) эмпирическую через измерение обеспечивают, — (включает В. И. Паниотто, — то валидность теоретическую только проверяют, т. е. уточняют область валидности методики, границы интерпретации получаемых материалов" [200. С. 109].
Устойчивость измерения выражается в однозначности информации, которую мы извлекаем с помощью данной процедуры. Нередко устойчивость ошибочно отождествляют с надежностью процедуры в целом. И хотя последняя зависит не только от устойчивости, но также от обоснованности и правильности операций, подобное смешение не случайно: проверка инструмента на устойчивость — важнейшее условие его надежности.
1) Наиболее распространенный прием контроля на устойчивость — повторное измерение. Один и тот же объект измеряется дважды с двух-трехнедельным временным интервалом и с помощью одинаковой процедуры. Шкала считается устойчивой, если совпадения между первой и второй сериями измерений будут достаточно высокими.
В отличие от проверки на устойчивость измерения физических объектов социолог или психолог сталкивается здесь с особой проблемой — влиянием психологической установки человека, возникающей после первого замера. Люди могут намеренно или непроизвольно подгонять данные второго замера к предыдущим. Или же, напротив, интуитивно сопротивляясь повторному эксперименту, они покажут новые результаты.
Таблица 2
Сравнение данных двух последовательных замеров: оценка совпадения (+) и несовпадения (—) результатов в дихотомической шкале
Пункты шкалы |
Обследуемые всего, N-50 чел. |
Итог по строке |
||||||
А |
В |
В |
Г |
...n |
(+) |
(-) |
% совпадений |
|
1 |
+ |
+ |
- |
+ |
+ |
45 |
5 |
90 |
2 |
+ |
- |
+ |
+ |
+ |
44 |
б |
88 |
3 |
- |
+ |
- |
- |
- |
25 |
25 |
50 |
4 |
+ |
+ |
+ |
- |
+ |
42 |
8 |
84 |
Б |
+ |
+ |
+ |
- |
+ |
46 |
4 |
92 |
в |
+ |
+ |
- |
+ |
+ |
41 |
9 |
82 |
15 |
+ |
+ |
- |
+ |
+ |
45 |
5 |
90 |
Итог по (+) колонке ( - ) |
141 |
141 |
96 |
10 5 |
13 2 |
635 |
115 |
90 |
Чтобы устранить такой дефект, используют контрольную группу (см. гл. 5, С. 357—361). Простейший же способ снять влияние установки первого замера — производить повторный замер спустя достаточное время после первого (например, две недели) и на достаточно большой выборке испытуемых (около 50 человек). Составив таблицу замеров для всех обследуемых, мы далее анализируем, какова общая устойчивость данных и от чего зависят отклонения между двумя замерами (табл. 2, пример Г. И. Саганенко).
При повторных измерениях используют различные оценки устойчивости данных, одна из которых — это процент полных совпадений ответов на серию вопросов в двух последовательных пробах методики. Соответствующая формула:
где в числителе п — количество полностью совпавших пар ответов, а в знаменателе Л7 — общая численность испытуемых, р — процент устойчивости.
По этой формуле, для примера, в табл. 2 получим:
Таблица 3
Сравнение данных двух последовательных замеров в трехчленной шкале (N=28 чел.)
Ответы в I пробе о занятиях на досуге |
Ответы в 11 пробе |
Всего |
||
|
"Привл." (1) |
"Не очень"(2) |
"Не привл." (3) |
|
"Данное занятие привлекательно" (1) "Не очень привлекательно" (2) "Занятие непривлекательно" (3) |
7
4
- |
3
6
3 |
-
1
4 |
10
11
7 |
Всего |
11 |
12 |
5 |
28 |
Другим весьма полезным показателем полной устойчивости является мера сдвига, оцененная как среднеарифметическая ошибка различения градаций шкалы. Этот показатель обозначает, какую долю градации данной шкалы (в среднем) все испытуемые как бы не улавливают, т. е. каковы истинные границы различения градаций.
Например, уточним среднеарифметическую ошибку в различении трехчленной школы согласия — несогласия с каким-то суждением (пусть это будет суждение о привлекательности некоторого занятия на досуге). Приведем схему (табл. 3) и расчеты, используя данные таблицы Г. И. Саганенко.
В испытании участвуют 28 человек, из которых 17 полностью повторяют свои оценки данного занятия в обеих пробах (сумма по диагонали схемы: 7+6+4 = 17), а остальные 11 испытуемых дают разные ответы в двух пробах. Для оценки искомой ошибки вычисляем отличия ответов респондентов как сдвиги между II и I пробами, например, во II пробе из тех, кто в I пробе ответил "занятие привлекательно", 3 человека сообщили, что оно "не очень привлекательно", т. в. это разность (2—1) 3. Теперь суммируем все разности в ответах и получим меру среднеарифметической ошибки различения пунктов градации данной шкалы:
Значит, среднеарифметический "сдвиг" в оценке по трехчленной шкале составляет около 40% одного ее деления, т. е. менее половины деления, что в общем можно признать удовлетворительным, хотя и не идеальным. (Ниже, говоря о правильности измерения, мы покажем, как можно было бы уменьшить эту ошибку.)
Рассматривая устойчивость как воспроизводимость результатов измерений, можно использовать и иные показатели ее меры [200. С. 33—34], например, обычные расчеты корреляции итогов двух последовательных измерений. Показатели, рекомендуемые Г. И. Саганенко, представляются нам вполне адекватными и наглядными.
Какая же мера устойчивости удовлетворительна? Это Зависит от существа измеряемого свойства, его значимости для целей и задач исследования. В принципе для немногочленной шкалы среднеарифметическая ошибка различения градаций в 40% ее деления невысока, а соответствующая мера устойчивости (100%—40% =60%) вполне достаточна, ибо не перекрываются границы меж-ДУ двумя соседними интервалами шкалы. Если неустойчивость составила не 40%, а 60%, т. е. более половины деления шкалы, то ошибка была бы явно недопустима, ибо в среднем испытуемые не различают две соседние Градации из трех.
Для многочленных ш