ПСИХОМЕТРИЧЕСКИЕ ПСИХОДИАГНОСТИКИ

  Главная      Учебники - Медицина     

 поиск по сайту           правообладателям

 

 

 

 

 

 

 

 

содержание   ..  1  2  3  4  ..

 

 

 

ГЛАВА 3

ПСИХОМЕТРИЧЕСКИЕ ПСИХОДИАГНОСТИКИ

 

3.1. РЕПРЕЗЕНТАТИВНОСТЬ ТЕСТОВЫХ НОРМ

 

Основные статистические принципы построения тестов достаточ­но полно освещены в появившейся в начале 80-х годов на русском языке литературе по дифференциальной психометрике (Аванесов В. С., 1982; Анастази А., 1982; Гайда В. К., Захаров В. П., 1982). Тем не менее в указанных руководствах центральная проблема пси­хометрики тестов - вопрос о тестовых нормах - еще не получила пос­ледовательного освещения. Прежде всего это относится к руковод­ству известной представительницы американской тестологии А. Ана­стази.

В руководстве Анастази не получают достаточного критического обсуждения две основополагающие предпосылки традиционной за­падной тестологии: вопрос о применении статистических норм (кван­тилей распределения баллов) в качестве диагностических норм и воп­рос о сведении всех эмпирических распределений к нормальной мо­дели. Ниже эти предпосылки будут проанализированы в контексте краткой реконструкции системы основных понятий дифференциаль­ной психометрики.

Статистическая природа тестовых шкал. Типичный измери­тельный тест в психодиагностике - это последовательность кратких заданий, или пунктов, дающая в результате ее выполнения испытуе­мым последовательность исходов, которая затем подвергается одно­значной количественной интерпретации. Примеры интерпретации в интеллектуальных тестах, состоящих из отдельных задач: «правиль­ное решение», «ошибочное решение», «отсутствие ответа» (пропуск задачи из-за нехватки времени). Примеры интерпретации в случае лич­ностных опросников, состоящих из высказываний, предлагаемых для подтверждения испытуемым: «подтверждение» (ответ «верно»), «от­вержение» (ответы «не согласен», «неверно»).

Суммарный балл по тесту подсчитывается с помощью ключа: ключ устанавливает числовое значение исхода по каждому пункту. Напри­мер, за правильное решение задания дается «+1», за неправильное решение или пропуск - «О». Тогда балл буквально выражает количе­ство правильных ответов.

Исход по отдельному заданию подвержен воздействию не только со стороны измеряемого фактора - способности или черты личности испытуемого, но и побочных шумовых факторов, которые являются иррелевантными по отношению к задаче измерения. Примеры слу­чайных факторов: колебания внимания, вызванные неожиданными от­влекающими событиями (шум на улице, стук в дверь и т. п.), трудно­сти в понимании смысла задания (вопроса), вызванные особенностя­ми опыта данного конкретного испытуемого, и т. п. Последователь­ность исходов оказывается последовательностью событий, содержа­щей постоянный и случайный компоненты. Как известно, основным приемом, позволяющим устранить искажающее влияние случайных факторов на результат (суммарный балл), Является балансировка это­го влияния с помощью повторения. При этом фактически предпола­гается, что повторение обеспечивает рандомизацию (случайное варь­ирование) неконтролируемого фактора, в результате чего при сумми­ровании исходов Положительные и негативные эффекты случайных факторов взаимопоглощаются (о механизме рандомизации см.: Готтсданкер Р., 1982).

В оптимальном тесте набор и последовательность заданий орга­низуются таким образом, чтобы повысить долю постоянного компо­нента и сократить долю случайного в величине суммарного балла. Тем не менее, несмотря на различные статистические ухищрения, суммарный балл в психологических измерениях содержит несравнен­но большую долю случайного компонента, чем в обычных физичес­ких измерениях. В силу этого суммарный балл оказывается опреде­ленным лишь в известных пределах, заданных ошибкой измерения.

Для того чтобы оценить эффективность, дифференциальную цен­ность всей процедуры измерения, необходимо соотнести размеры ошибки измерения с размерами разброса суммарных баллов, вызван­ных индивидуальными различиями в измеряемой характеристике между испытуемыми. В терминах Статистики речь идет о сравнении так называемой истинной дисперсии распределения суммарных баллов с дисперсией ошибки. Именно этим обусловлен необходимый интерес психометристов к распределению суммарных баллов. Поэто­му анализ распределения необходим не только при использовании статистических норм, но и в случае абсолютных и критериальных норм.

Как известно, частотное распределение суммарных баллов имеет удобную графическую интерпретацию в виде кривых распределений: гистограммы и кумуляты (см., в частности, удачное популярное вве­дение в описание распределений в книге: Кимбл Г., 1982, с. 55-70). В случае гистограммы по оси абсцисс откладываются «сырые очки» -первичные показатели суммарных баллов, возможных для данного теста, по оси ординат - относительные частоты (или проценты) встре­чаемости баллов в выборке стандартизации (Анастази А., 1982, с. 66). Как известно, для «колоколообразной» кривой нормального распре­деления дисперсия визуализируется как параметр, ответственный за «распластанность» графика плотности вероятности (теоретического аналога эмпирической кумуляты) вдоль оси X. Чтобы визуализиро­вать дисперсию ошибки измерения, нужно было бы многократно про­вести тест с одним испытуемым и построить графическое распреде­ление частот его индивидуальных баллов (рис. 1).

Очевидно, что дифференцирующая способность теста сводится к нулю, если кривые, иллюстрирующие «истинную» и «ошибочную» дисперсии» совпадают. Как видим, анализ распределения тестовых баллов необходим уже для анализа надежности теста (см. раздел 3.2).

Проблема меры в психометри­ке и свойства пунктов теста. В физических измерениях калибров­ка шкалы производится на основе контроля за равномерным варьиро­ванием измеряемого свойства в эта­лонных объектах. Носителем меры является эталон- физический объект, стабильно сохраняющий заданную величину измеряемого свойства. В дифференциальной психометрике такие физические эталоны отсутствуют: мы не располагаем индивидами, которые были бы постоянными носителями за­данной величины измеряемого свойства.

 Рис. 1.Соотношение индивидуальной и общей вариации тестовых баллов

 

Роль косвенных эталонов в психометрике выполняют сами тесты: в том смысле, в каком труд­ность задач можно рассматривать как величину, прямо пропорцио­нально сопряженную со способностью (чем труднее задача, тем выше должен быть уровень способности, требуемый для ее решения). Ана­логом понятия «трудность» для «ли-вопросов»[10] опросника является «сила»: более «сильные» высказывания (в логическом смысле) вызы­вают подтверждение (согласие) у меньшего числа испытуемых. Ни трудность, ни силу пунктов теста нельзя выявить иначе, чем с помо­щью проведения теста. Операциональным определением трудности оказывается «процентильная мера»: процент испытуемых, справив­шихся с заданием теста (или ответивших «верно» на «ли-вопрос»). Чем меньше процент, тем выше трудность.

Кривая распределения тестовых баллов отражает свойства пунк­тов, из которых составлен тест. Если кривая имеет правостороннюю асимметрию, то в тесте преобладают трудные задания; если кривая имеет левостороннюю асимметрию, значит, большинство пунктов в тесте - легкие (слабые) (рис. 2).

 

Рис. 2.Асимметрии распределения тестовых баллов

 

Тесты первого типа плохо дифференцируют испытуемых с низ­ким уровнем способностей: все эти испытуемые получают примерно одинаковый низкий балл. Тесты второго типа, наоборот, хуже диффе­ренцируют испытуемых с высоким уровнем способностей.

Если пункты обладают оптимальным уровнем трудности (силы), то кривая распределения зависит от того, насколько пункты однород­ны. Если пункты разнородны (исход по одному пункту не предопре­деляет исход по другому), то мы получаем тест в виде последователь­ности независимых испытаний Бернулли. Как известно из математи­ческой статистики, при достаточно большом количестве независимых испытаний с двумя разновероятными исходами кривая биномиально­го распределения (кривая суммарного балла) по закону больших чи­сел автоматически приближается к кривой нормального распределе­ния (центральная предельная теорема Муавра - Лапласа). Если тест содержит разнородные задания примерно равного уровня трудности (именно такие задания и подбираются для измерения интегральных свойств личности), то нормальность распределения суммарных бал­лов возникает автоматически - как артефакт самой процедуры под­счета суммарных баллов. При этом, конечно, форма кривой распре­деления баллов не позволяет говорить о реальной форме распределе­ния измеряемого свойства, каким оно является само по себе - в ши­рокой популяции испытуемых. Нормальность распределения есть артефакт, прямое следствие направленного отбора пунктов с задан­ными свойствами.

Если подбираются пункты, тесно положительно коррелирующие между собой (испытания не являются статистически независимыми), то в распределении баллов возникает отрицательный эксцесс (рис. 3,а), Максимальных значений отрицательный эксцесс достигает по мере возрастания вогнутости вершины распределения - до образования двух вершин -двух мод (с «провалом» между ними -рис. 3,6). Бимо­дальная конфигурация распределения баллов указывает на то, что вы­борка испытуемых разделилась на две категории (с плавными пере­ходами между ними): одни справились с большинством заданий (со­гласились с большинством «ли-вопросов»), другие - не справились.

 

Рис. 3. Отрицательные (а, б) положительный (в) эксцессы распределения тестовых баллов

 

Такая конфигурация распределения свидетельствует о том, что в ос­нове пунктов лежит какой-то один общий им всем признак, соответ­ствующий определенному свойству испытуемых: если у испытуемых есть это свойство (способность, умение, знание), то они справляются с большинством пунктов, если этого свойства нет - то не справляют­ся. В некоторых редких ситуациях пункты могут отрицательно корре­лировать друг с другом. В этом случае на кривой возникает положи­тельный эксцесс (рис. 3, в): вся масса эмпирических точек собирается вблизи среднего значения. Такое возможно в двух случаях: 1) когда ключ составлен неверно -объединены при подсчете отрицательно свя­занные признаки, которые обусловливают взаимоуничтожение бал­лов; 2) когда испытуемые применяют, разгадав направленность оп­росника, специальную тактику «медианного балла» - искусственно балансируют ответы «за» и «против» одного из полюсов измеряемого качества.

Итак, когда в качестве единственного эталона измерения психодиагностами рассматривается сам тест, то в качестве меры измеряе­мого свойства выступает положение балла на кривой распределения. Применяется процентильная шкала. В качестве универсальной меры, пригодной для разных (по своей качественной направленности и ко­личеству пунктов) тестов, используется «процентильная мера». Процентилъ — процент испытуемых из выборки стандартизации, кото­рые получили равный или более низкий балл, чем балл данного испы­туемого. Таким образом, в качестве источника данной меры высту­пает нормативная выборка (выборка стандартизации), на которой построено нормативное распределение тестовых баллов. Процентильные шкалы лежат в основе всех традиционных шкал, применяе­мых в тестологии (Т-очки MMPI, баллы IQ, стены 16 PF и др.).

Подчеркнем, что с точки зрения теории измерений, процентильные шкалы относятся к порядковым шкалам: они дают информацию о том, у кого из испытуемых сильнее выражено измеряемое свойство, но не позволяют говорить о том, во сколько раз сильнее. Для того чтобы строить на базе таких шкал количественный прогноз, нужно повысить уровень измерения (популярное изложение представлений о теории измерений см. в книге: Клигер С. А. и др., 1978). Переход к шкалам интервалов производят либо на базе эмпирического распределения, либо на базе произвольной модели теоретического распределения. В абсолютном большинстве случаев в роли такой теоретической модели ока­зывается модель нормального распределения (хотя в принципе может быть использована любая модель).

В целом кроме статистических, процентильных шкал следует от­личать нередко используемые в дифференциальной психометрике еще 2 вида шкал (и соответственно 2 вида тестовых норм). Это, во-пер­вых, то, что можно условно назвать «абсолютными тестовыми нор­мами» — в роли шкалы для вынесения диагноза выступает сама шкала «сырых» очков, во-вторых, «критериальные» тестовые нормы. При­менение таких норм можно считать оправданным в двух случаях: 1) когда сама тестовая «сырая» шкала имеет практический смысл (на­пример, студент, изучающий иностранный язык, должен знать как можно больше слов этого языка, и сырой показатель лексического теста имеет практический смысл); 2) когда сырой балл по тесту в ре­зультате эмпирических исследований связывается с заданной вероят­ностью успешности какой-либо практической деятельности (вероят­ность успеха «критериальной» деятельности, каковой для упомяну­того выше примера может быть синхронный перевод монолога в те­чение 30 минут).

Процентильная нормализация шкалы. Выше Показано, что нор­мальность распределения достигается искусственным подбором пун­ктов теста с заданными статистическими свойствами: Опишем еще ряд процедур, которые также широко используются для искусствен­ной нормализации.

1. Нормализация пунктов. Ключ для данного пункта корректиру­ется на базе нормальной модели. Если среди нормативной выборки с данным заданием справились только 16 % испытуемых, то данному пункту на интервальной шкале «трудности» (при условии априорно­го принятия нормальной модели с параметрами М = 0 и а = 1) соот­ветствует значение +1 (см. график в книге: Анастазй А., 1982, с. 181). Если справились 75 % испытуемых, то балл пункта на сигма-шкале равен-0,67. В результате суммирования по пунктам баллов, скоррек­тированных нормализацией, суммарные баллы лучше приближаются к нормальному распределению.

2.  Нормализация распределения суммарных баллов (или интер­вальная нормализация). В этом случае по таблице нормального рас­пределения (нормального интеграла) производится переход от процентильной шкалы к сиг­ма-шкале: используется функция, обратная интег­ральной, - от ординаты производится переход к абсциссе нормального рас­пределения.

 

 

Рис. 4. Преобразование процентильной шкалы (по оси X) в нормализованную сигма-шкалу (по оси Y)

 

 

На рис. 4 дана условная графическая ил­люстрация этого перехода (кривая, обратная традици­онной S-образной интег­ральной кривой нормаль­ного распределения).

Приведем пример интервальной нормализации (табл. 3). Пусть строка X содержит сырые баллы (не нормализованные) по тесту, по­лученные простым подсчетом правильных ответов. В строке Р - час­тоты встречаемости сырых баллов в выборке из 62 испытуемых. В строке F - кумулятивные частоты: =. В строке F* - кумулятивные баллы: . В строке PR - процентильные ранги: . В строке σ даются нормализованные баллы, по­лученные из соответствующих процентильных рангов по таблицам, а -оценки часто называются в зарубежной литературе также z-оценками.

Таблица 3

 

X

P

F

F*

PR

σ

3

2

2

1

1,6

-2,1

4

18

20

11

17,7

-0,9

5

13

33

26,5

42,7

-0,2

6

8

41

37

59,7

0,2

7

10

51

46

74,2

0,6

8

6

57

54

87,1

1,1

9

4

61

59

95,2

1.7

10

1

62

61.5

99.2

2.4

 

n=62

 

 

Σ=100

M=0

 σ =1

Трудность, с которой сталкиваются начинающие при использова­нии интервальной нормализации, состоит в том, что обычные статис­тические таблицы не приспособлены для психометрики: нужно отыс­кивать значение процентильного ранга внутри таблицы, а соответству­ющую сигма-оценку – с  краю. Для облегчения ориентации приведем фрагмент таблицы соответствий PR, а и стенов (табл. 4):

Таблица 4

PR

σ

стен

99

2,33

10

95

1,64

10

90

1,28

9

85

1,04

8

80

0,84

8

75

0,68

7

70

0,52

6,5

65

0,39

6,5

50

0,25

6

55

0,13

6

 

PR

σ

стен

50

0,0

5,5

45

-0,13

5

40

-0,25

 

35

-0,39

4,5

30

-0,52

4

25

-0,68

4

20

-0,84

15

-1,04

3

10

-1,28

2

5

-1,64

1

1

-2,33

1

 

В обычных таблицах из соображений симметрии даны лишь зна­чения для PR > 50. Для PR < 50 соответствующие значения находят­ся из тех же таблиц σ = ψ -1(1- PR/100). Например, для PR =35 мы находим 1 - PR/100 = 1 - 0,35 = 0,65, затем - по табл. ψ  -1 = 0,39 и бе­рем это значение с отрицательным знаком -0,39. Для нормализации удобно пользоваться графическим методом (нормальной бумагой, стандартной 5-образной кривой и т. п.).

В результате нормализации интервалы между исходными сыры­ми баллами переоцениваются в соответствии с нормальной моделью. В отличие от процентильной шкалы, нормальная шкала придает боль­ший вес (в дифференциации испытуемых) краям распределения: раз­личия между испытуемыми, набравшими 95 и 90 процентилей, оце­ниваются как более высокие, чем различия между испытуемыми, набравшими 65 и 60 процентилей.

В применении к шкалам оценок (рейтинговым шкалам) метод нормализации интервалов называется «методом последовательных интервалов» (Клигер С. А. и др., 1978, с. 75-81).

В результате применения процедуры нормализации исследователь-психометрист получает для нормативной выборки таблицу перевода сырых баллов в нормализованные баллы. На основе этих таблиц час­то строят графики: деления сырых баллов наносят на числовую ось с неравными интервалами, так что эмпирическое распределение час­тот максимально близко приближается к нормальной форме. Пример такой графической нормализации - профильные листы MMPI (Анастази А., 1982, с. 129).

Так как нормальное распределение описывается всего двумя па­раметрами: средним М (мерой положения) и средним квадратическим (или стандартным) отклонением а (мерой рассеяния), то диаг­ностические нормы в случае нормализованных шкал описываются в единицах отклонений от среднего по выборке; например, заключают, что испытуемый А показал результат, превышающий средний балл на две сигмы, испытуемый В -результат, оказавшийся ниже среднего балла на одну сигму, и т. п. На процентильной шкале этому соответ­ствуют процентильные ранги 95 и 16 соответственно.

Переход к нормальному распределению создает очень удобные условия для количественных операций с диагностической шкалой: как со шкалой интервалов с ней можно производить операции ли­нейного преобразования (умножение и сложение), можно описы­вать диагностические нормы в компактной форме (в единицах от­клонений), можно применять линейный коэффициент корреляции Пирсона, критерии для проверки статистических гипотез, постро­енные в применении к нормальному распределению, т. е. весь ап­парат традиционной статистики (основанной на нормальном рас­пределении).                           !

Неправомерность онтологизации нормального закона. В тради­ционной психометрике нормальное распределение выступает в роли инструментального понятия, облегчающего оперирование с данны­ми. Но это не означает, что можно забывать об искусственном проис­хождении нормального распределения. Традиции западной тестологии, основанные еще Ф. Гальтоном, предполагают однородность тео­ретических представлений психометрики и биометрики. Точно так же как происхождение нормального распределения при исследовании вариативности биологических характеристик человеческого организма связывается с наличием взаимодействия постоянного фактора гено­типа и изменчивых случайных факторов фенотипа, - происхождение межиндивидуальных психологических различий связывается с гене­тическим кодом, якобы предопределяющим положение индивида на оси нормальной кривой. В действительности же нет никаких оснований приписывать появление нормальной кривой, часто получаемой с помощью специальных статистических непростых процедур, дей­ствию механизма наследственности.

В тех случаях, когда на большой выборке удается получить нор­мальное распределение без каких-либо искусственных способствую­щих этому мер, это опять-таки не означает вмешательства генетики. Закон нормального распределения воспроизводится всякий раз, когда на измеряемое свойство (на формирование определенного уровня спо­собностей индивида) действует множество разных по силе и направ­ленности факторов, независимых друг от друга. История прижизнен­ных средовых воздействий, которые испытывает на себе субъект, так­же подобна последовательности независимых событий: одни факторы действуют в благоприятном направлении, другие - в неблагоприятном, а в результате взаимопогащение их влияний происходит чаще, чем тен­денциозное однонаправленное сочетание (большинство благоприятных или большинство неблагоприятных), т. е. возникает нормальное рас­пределение. Массовые исследования показывают, что введение конт­роля над одним из средовых популяционных факторов (уровень обра­зования родителей, например) приводит к расслоению кривой нормаль­ного распределения: выборочные кривые оказываются смещенными относительно друг друга (Анастази А., 1982, с. 201). Эти результаты служат ярким подтверждением социокультурного происхождения ста­тистических диагностических норм, что одновременно служит осно­ванием для серьезных предосторожностей при переносе норм, полу­ченных на одной популяции, на другие популяции. Однородными мож­но считать только те популяции, по отношению к которым действует одинаковый механизм выборки: ив ситуации создания (стандартиза­ции) теста, и в ситуации его диагностического применения. Здесь при­ходится учитывать и такие нюансы выборочного механизма, как фено­мен нормальных добровольцев. Если выборку стандартизации форми­ровать на студентах, добровольно согласившихся участвовать в тести­ровании, а применение теста планируется на сплошных выборках (в административном порядке), то это грозит определенными ошибками в диагностических суждениях, так как психологический портрет «доб­ровольца» в существенных чертах отличается от портрета испытуемо­го, соглашающегося на тестирование только под административным давлением (Шихирев П.Н, 1979, с. 181).

Подсчет параметров и оценка типа распределения. Для описа­ния выборочного распределения, как правило, используются следую­щие известные параметры:

 

 

 

 

1. Среднее арифметическое значение:

,                             (3.1.1)

где xj – балл  i-го испытуемого;

yi -значение i-го балла по порядку возрастания;

pi - частота встречающегося i-го балла;

n - количество испытуемых в выборке (объем);

m - количество градаций шкалы (количество баллов).

 

2.                     Среднее квадратическое (стандартное) отклонение:

3.                      

,                       (3.1.2)

 

где - сумма квадратов тестовых баллов для и испытуемых.

3. Асимметрия:

                                                             (3.1.3)

где  - среднее арифметическое значение;

S - стандартное отклонение;

θ - среднее кубическое значение: ,

С - среднее квадратическое:

4. Эксцесс:

,              (3.1.4)

где Q - среднее значение четвертой степени: .

Стандартная ошибка среднего арифметического значения (мате­матического ожидания) оценивается по формуле:

                                               (3.1.5)

На основе ошибки математического ожидания строятся довери­тельные интервалы: )

Если тестовый балл какого-либо испытуемого попадает в грани­цы доверительного интервала, то нельзя считать, что испытуемый обладает повышенным (или пониженным) значением измеряемого свойства с заданным уровнем статистической значимости.

Асимметрия и эксцесс нормального распределения должны быть равны нулю. Если хотя бы один из двух параметров существенно от­личается от нуля, то это означает анормальность полученного эмпи­рического распределения.

Проверку значимости асимметрии можно произвести на основе общего неравенства Чебышева:

                                        (3.1.6)

где Sa - дисперсия эмпирической оценки асимметрии:

,                                         (3.1.7)

где р - уровень значимости или вероятность ошибки первого рода: ошибки в том, что будет принят вывод о незначимости асимметрии при наличии значимой асимметрии (в формулу подставляют стандар­тные р = 0,05 или р = 0,01 и проверяют выполнение неравенства). Сходным образом оценивается значимость эксцесса:

                                 (3.1.8)

где Sе - эмпирическая дисперсия оценки эксцесса:

 

.                        (3.1.9)

]

Гипотезы об отсутствии асимметрии и эксцесса принимаются с вероятностью ошибки р (пренебрежимо малой), если выполняются неравенства (3.1.6) и (3.1.8).

Более легкий метод проверки нормальности эмпирического рас­пределения основывается на универсальном критерии Колмогорова. Для каждого тестового балла у. (для каждого интервала равнозначно­сти при дискретизации непрерывной хронометрической шкалы) вы­числяется величина D. - модуль отклонения эмпирической и теорети­ческой интегральных функций распределения:

                               (3.1.10)

где F- эмпирическая интегральная функция (значение кумуляты в данной точке уj); U — теоретическая интегральная функция, взятая из таблиц[11]. Среди Dj отыскивается максимальное значение Dmax, и вели­чина сравнивается с табличным значением  критерия Колмогорова.

В таблице 5 приведены асимптотические критические значения для распределения Колмогорова (при ). Близость эмпиричес­кого значения λе к левосторонним стандартным квантилям λt позво­ляет констатировать близость эмпирического и предполагаемого тео­ретического распределения с пренебрежимо малой вероятностью ошибки р (0,01; 0,05; 0,10 и т, п.). Близость λе к правосторонним стан­дартным квантилям λ­­t позволяет сделать вывод о статистически зна­чимом отсутствии согласованности эмпирического и теоретического распределений. Надо помнить, что критерий Колмогорова, очень про­стой в вычислительном' отношении, обеспечивает надежные выводы лишь при 200: Критерий Колмогорова резко снижает свою эф­фективность, когда наблюдения группируются по малому количеству интервалов равнозначности. Например, при n = 200 количество ин­тервалов должно быть не менее 20 (примерно по 10 наблюдений на каждый интервал в среднем).

Таблица 5

 

Квантиль λt

0,44

0,52

0,57

0,61

0,65

0,71

 

Вероятность p

0,99

0,95

0,90

0,85

0,80

0,70

 

Квантиль λt

0,89

0,97

1,07

1,22

1,36

1,52

1,63

Вероятность p

0,40

0,30

0,20

0,15

0,05

0,02

0,01

 

Если проверка согласованности эмпирического распределения с нормальным дает положительные результаты, то это означает, что полученное распределение можно рассматривать как устойчивое -репрезентативное по отношению к генеральной совокупности - и, следовательно, на его основе можно определить репрезентативные тестовые нормы. Если проверка не выявляет нормальности на требу­емом уровне, то это означает, что либо выборка мала и нерепрезента­тивна к популяции, либо измеряемые свойство и устройство теста (спо­соб подсчета) вообще не дают нормального распределения.

В принципе отнюдь не обязательно все нормативные распределе­ния сводить к нормальным. Можно с равным успехом пользоваться хорошо разработанными моделями гамма-распределения, пуассоновского распределения и т. п. Критерий Колмогорова позволяет оценить близость вашего эмпирического распределения к любому теоретичес­кому распределению. При этом устойчивым и репрезентативным мо­жет оказаться распределение любого типа. Если из нормальности, как правило, следует устойчивость, то обратное неверно -устойчивость вовсе не обязательно предполагает нормальность распределения.

Наличие значимой положительной асимметрии (см. рис. 2,а) сви­детельствует о том, что в системе факторов, детерминирующих зна­чение измеряемого показателя, преобладают факторы, действующие в одном направлении - в сторону повышения показателя. Такого рода отклонения появляются при использовании хронометрических пока­зателей: испытуемый не может решить задачу быстрее определенно­го минимально необходимого периода, но может существенно долго задерживаться с ее решением. На практике распределения такого рода преобразуют в приближенно нормальное распределение с помощью логарифмической трансформации:

                                              (3.1.11)

 

При этом говорят, что распределение хронометрических показа­телей подчиняется «логнормальному» закону.

Подобную алгебраическую нормализацию тестовой шкалы при­меняют и к показателям с еще более резко выраженной положитель­ной асимметрией. Например, в процедурах контент-анализа сам тес­товый показатель является частотным: он измеряет частоту появле­ния определенных категорий событий в текстах. Для редких катего­рий вероятность появления значительно меньше 0,5. Формула преобразования

 

                                           (3.1.12)

 

позволяет придать необходимую 5-образную форму кумуляте.

Стандартизация шкалы. В психометрике следует различать две формы стандартизации. Под стандартизацией теста понимают преж­де всего стандартизацию самой процедуры проведения инструкций, бланков, способа регистрации, условий и т. п. Без стандартизации теста невозможно получить нормативное распределение тестовых баллов и, следовательно, тестовых норм.

Под стандартизацией шкалы понимают линейное преобразование масштаба нормальной (или искусственно нормализованной) шкалы. В общем случае формула стандартизации выглядит так:

,                              (3.1.13).

где xi - исходный балл по «сырой» шкале, для которой доказана нор­мальность распределения;

- среднее арифметическое по «сырому» распределению; S - «сырое» стандартное отклонение;

М- математическое ожидание по выбранной стандартной шкале;

σ - стандартное отклонение по стандартной шкале.

Если шкала подвергалась предварительной искусственной норма­лизации интервалов, то формула упрощается:

zj =σ zj =M                                                (3.1.14)

 

Приведем параметры для наиболее популярных стандартных шкал:

1)  T -шкала Маккола (тест-опросник MMPI и другие тесты):

М = 50 и σ = 10,

2) шкала IQ : М = 100 и σ = 15,

3) шкала «стэнайнов» (целые численные значения от 1 до 9 -стан­дартная девятка): М = 5,0 и σ = 2,

4) шкала «стенов» (стандартная десятка, 16PF Кеттелла):

М = 5,5 .и σ  = 2.

Чтобы различать стандартные баллы, полученные с помощью линейной стандартизации и нелинейной нормализации интервалов, Р. Кеттелл ввел понятие «S-стенов» и «n-стенов». Таблицы «и-стенов», естественно, точнее отражают квантили эмпирического нормального распределения. Приведем образец такой таблицы для фактора А из тест-опросника 16PF;

 

Сырые баллы   0-4  5-6    7     8-9    10-12    13    14-15    16   17-18 19-20   Стены               1      2     3       4         5        6       7        8       9        10

 

Применение стандартных шкал позволяет использовать более грубые, приближенные способы проверки типа распределения тесто­вых баллов. Если, например, процентильная нормализация с перево­дом в стены и линейная нормализация с переводом в стены по фор­муле (3.1.13) дают совпадающие целые значения стенов для каждого Y, то это означает, что распределение обладает нормальностью с точ­ностью до «стандартной десятки».

Применение стандартных шкал необходимо для соотнесения ре­зультатов по разным тестам, для построения «диагностических про­филей» по батарее тестов и тому подобных целей.

Проверка устойчивости распределения. Общая логика проверки устойчивости распределения основывается на индуктивном рассуж­дении: если половинное (полученное по половине выборки) распре­деление хорошо моделирует конфигурацию целого распределения, то можно предположить, что это целое распределение будет также хоро­шо моделировать распределение генеральной совокупности.

Таким образом, доказательство устойчивости распределения оз­начает доказательство репрезентативности тестовых норм. Традици­онный способ доказательства устойчивости сводится к наличию хо­рошего приближения эмпирического распределения к какому-либо те­оретическому. Но если эмпирическое распределение не приближается к теоретическому, несмотря на значительное увеличение объема выборки, то приходится прибегать к более общему индуктивному ме­тоду доказательства.

Простейший его вариант может быть сведен к получению таблиц перевода сырых баллов в нормализованную шкалу по данным всей выборки и применению этих таблиц для каждого испытуемого из по­ловины выборки; если распределение нормализованных баллов из по­ловины выборки хорошо приближается к нормальному, то это значит, что заданные таблицами нормализации тестовые нормы определены устойчиво. Близость к нормальному распределению проверяется с по­мощью критерия Колмогорова (при n <200 целесообразно использо­вать более мощные критерии: «хи-вадрат» или «омега-квадрат»).

При этом под «половиной выборки» подразумевается случайная половина, в которую испытуемые зачисляются случайным образом -с помощью двоичной случайной последовательности (типа подбра­сывания монетки и т. п.). В более общем случае такой простейший метод установления однородности двух эмпирических распределений может быть применен и при разбиении выборки по какому-либо сис­тематическому признаку. Если, в частности, по какому-либо из популяционно значимых признаков (пол, возраст, образование, профес­сия) психолог получает значимую неоднородность эмпирических распределений; то это значит, что относительно данных популяционных категорий тестовые нормы должны быть специализированы (одна таблица норм - для мужчин, другая - для женщин и т. д.).

Более статистически корректный метод проверки однородности двух распределений, полученных при расщеплении выборки на рав­ные части, опять же связан с применением критерия Колмогорова. Для этого с табличным значением сравнивается:

 

                                  (3.1.15)

 

где Ке - эмпирическое значение статистики Колмогорова;

Fj1 - кумулятивная относительная частота для у-того интервала шкалы по первой половине выборки;

Fj2 - та же частота для второй половины;

n - полный объем выборки.

Точные значения квантилей распределения Колмогорова для опре­деления размеров выборки можно найти в кн.: Мюллер П. и др., 1982.

Применение критерия Колмогорова не зависит от нормальности целого распределения и от необходимости производить нормализа­цию интервалов.

*  *  *

 

Итак, априорная предпосылка нормальности распределения тес­товых баллов основывается скорее на принципах операционального удобства, чем на теоретической необходимости. Психометрически корректные процедуры получения устойчивых тестовых норм возмож­ны с помощью специальных методов непараметрической статистики (критерий «хи-квадрат» и т. п.) для распределений произвольной фор­мы. Выбор статистической модели распределения - законный произ­вол психометриста, пока сам тест выступает в качестве единственно­го эталона измеряемого свойства. В этом случае остается лишь тща­тельно следить за соответствием сферы применения диагностичес­ких норм той выборке испытуемых, на которой они были получены. Произвольность в выборе статистической модели шкалы исчезает, когда речь заходит о внешних по отношению к тесту критериях.

Репрезентативность критериальных тестов. В таких тестах в качестве реального эталона применяется критерий, ради которого со­здается тест, - целевой критерий. Особое значение такой подход имеет в тех областях практики, где высокие результаты могут дать узкоспеци­ализированные диагностические методики, нацеленные на очень кон­кретные и узкие критерии. Такая ситуация имеет место в обучении: тестирование, направленное на получение информации об уровне ус­воения определенных знаний, умений и навыков (При профессиональ­ном обучений), должно точно отражать уровень освоения этих навы­ков и тем самым давать надежный прогноз эффективности конкретной профессиональной деятельности, требующей применения этих навы­ков. Так возникают «тесты достижений», по отношению к которым критериальный подход обнаружил свою высокую эффективность (Гуревич К. М, Лубовский В. И,, 1982).

Рассмотрим операциональную схему шкалирования, применяе­мую при создании критериального теста. Пусть имеется некоторый критерий С, ради прогнозирования которого психодиагност создает тест X. Для простоты представим С как дихотомическую перемен­ную с двумя значениями: 1 и 0. С, = 1 означает, что j-й субъект достиг критерия (попал в «высокую» группу по критерию), Сj=0 означает, что i-й субъект не достиг критерия (попал в «низкую» группу). Пси­ходиагност применяет на нормативной выборке тест X, и в ре­зультате каждый индивид получает тестовый балл Xi. После того как для каждого индивида из выборки становится известным значение С (иногда на это требуются месяцы и годы после момента тестирова­ния), психодиагност группирует индивидов по порядку возрастания балла Xi и для каждого деления исходной шкалы сырых тестовых бал­лов подсчитывает эмпирическую вероятность Р попадания в «высо­кую» группу по критерию С. На рис. 5 показаны распределения веро­ятности Р (Ci = 1) в зависимости от Xi

 

 

Рис. 5 Эмпирическая зависимость между вероятностью критериального события и тестовым баллом

 

Очевидно, что кривая на рис. 5 по своей конфигурации может со­вершенно не совпадать с кумулятивной кривой распределения частот появления различных Xi. Кривая, представленная на рис. 5, является эмпирической линией регрессии С по Xi Теперь можно сформулиро­вать основное требование к критериальному тесту: линия регрессии должна быть монотонной функцией С от Xi Иными словами, ни для одного более высокого значения X. вероятность Р не должна быть мень­шей, чем для какого-либо менее высокого значения Xi Если это усло­вие выполняется, то открывается возможность для критериального шка­лирования сырых баллов X. Так же как в случае с интервальной норма­лизацией», когда применяется поточечный перевод интервалов Х в ин­тервалы Z, для которых выполняется нормальная модель распределения, так и при критериальном шкалировании к делениям сырой шкалы X применяется поточечный перевод прямо в шкалу Р на основании эмпи­рической линии регрессии. Например, если испытуемый А получил по тесту X 18 сырых баллов и этому результату соответствует Р=0,6, то испытуемому А ставится в соответствие показатель 60 %.

Конечно, любая эмпирическая кривая является лишь приближен­ной моделью той зависимости, которая могла бы быть воспроизведе­на на генеральной совокупности. Обычно предполагается, что на ге­неральной совокупности линия регрессии С по Х должна иметь более сглаженную форму. Поэтому обычно предпринимаются попытки ап­проксимировать эмпирическую линию регрессии какой-либо функ­циональной зависимостью, что позволяет затем производить прогноз с применением формулы (а не таблицы или графика).

Например, если линия регрессии имеет вид приблизительно та­кой, какой изображен на рис. 6, то применение процентильной нор­мализации позволяет получить простую линейную регрессию С по нормализованной шкале Z. Это как раз тот случай, когда имеет мес­то эквивалентность стратегии, использующей выборочно-статисти­ческие тестовые нормы, и стратегии, использующей критериальные нормы.

 

 

 Рис. 6. Зависимость вероятности критериального события Р от

нормально распределенного диагностического параметра X

 

Операции по анализу распределения тестовых баллов, построе­нию тестовых норм и проверке их репрезентативности. Завершая этот раздел, кратко перечислим действия, которые последовательно должен произвести психолог при построении тестовых норм.

1. Сформировать выборку стандартизации (случайную или стра­тифицированную по какому-либо параметру) из той популяции, на которой предполагается применять тест. Провести на каждом ис­пытуемом из выборки тест в сжатые сроки (чтобы устранить иррелевантный разброс, вызванный внешними событиями, происшедшими за время обследования).

2.  Произвести группировку сырых баллов с учетом выбранного интервала квантования (интервала равнозначности). Интервал опре­деляется величиной W/m , где W=x maxх max; m - количество интерва­лов равнозначности (градаций шкалы).

3.  Построить распределение частот тестовых баллов (для задан­ных интервалов равнозначности) в виде таблицы и в виде соответ­ствующих графиков гистограммы и кумуляты.

4. Произвести расчет среднего арифметического значения и стандар­тного отклонения, а также асимметрии и эксцесса с помощью компьюте­ра. Проверить гипотезы о значимости асимметрии и эксцесса. Сравнить результаты проверки с визуальным анализом кривых распределения.

5. Произвести проверку нормальности одного из распределений с помощью критерия Колмогорова (при n < 200 с помощью более мощ­ных критериев) или произвести процентильную нормализацию с пе­реводом в стандартную шкалу, а также линейную стандартизацию и сравнить их результаты (с точностью до целых значений стандарт­ных баллов).

6.  Если совпадения не будет - нормальность отвергается; в этом случае произвести проверку устойчивости распределения расщепле­нием выборки на две случайные половины. При совпадении норма­лизованных баллов для половины и для целой выборки можно счи­тать нормализованную шкалу устойчивой.

7. Проверить однородность распределения по отношению к варь­ированию заданного популяционного признака (пол, профессия и т. п.) с помощью критерия Колмогорова. Построить в совмещенных коор­динатах графики гистограммы и кумуляты для полной и частной вы­борок. При значимых различиях разбить выборку на разнородные подвыборки.

8. Построить таблицы процентильных и нормализованных тесто­вых норм (для каждого интервала равнозначности сырого балла). При наличии разнородных подвыборок для каждой из них должна быть своя таблица.

9.  Определить критические точки (верхнюю и нижнюю) для до­верительных интервалов (на уровне Р < 0,01) с учетом стандартной ошибки в определении среднего значения.

10. Обсудить конфигурацию полученных распределений с учетом предполагаемого механизма выполнения того или иного теста.

11. В случае негативного результата: отсутствия устойчивых норм для шкалы с заданным числом градаций (с заданной точнос­тью прогноза критериальной деятельности) - осуществить обсле­дование более широкой выборки или отказаться от использования, данного теста.

 

3.2. НАДЕЖНОСТЬ ТЕСТА

 

В дифференциальной психометрике проблемы валидности и надежности тесно взаимосвязаны, тем не менее мы последуем традиции раздельного изложения методов проверки этих важнейших пси­хометрических свойств теста.                                         

Надежность и точность. Как уже отмечалось в разделе 3.1, общий разброс (дисперсию) результатов произведенных измерений мож­но представить как результат действия двух источников разнообразия: самого измеряемого свойства и нестабильности измерительной процедуры, обусловливающей наличие ошибки измерения. Это пред­ставление выражено в формуле, описывающей надежность теста и виде отношения истинной дисперсии к дисперсии эмпирически заре­гистрированных баллов:

 

                                                (3.2.1)

 

Так как истинная дисперсия и дисперсия ошибки связаны оче­видным соотношением, формула (3.2.1) легко преобразуется в фор­мулу Рюлона:

 

                                               (3.2.2)

 

где а - надежность теста; . -дисперсия ошибки.               

Величина ошибки измерения - обратный индикатор точности из­мерения. Чем больше ошибка, тем шире диапазон неопределенности на шкале (доверительный интервал индивидуального балла), внутри которого оказывается статистически возможной локализация истинного балла данного испытуемого. Таким образом, для проверки гипо­тезы о значимости отличия балла испытуемого от среднего значения оказывается недостаточным только оценить ошибку среднего, нужно еще оценить ошибку измерения, обусловливающую разброс в поло­жении индивидуального балла (рис. 7).

 

 

Рис. 7. Соотношение распределений Sm – стандартное отклонение эмпирического среднего, St стандартное отклонение ошибки

 

Как же определить ошибку измерения? На помощь приходят кор­реляционные методы, позволяющие определить точность (надеж­ность) через устойчивость и согласованность результатов, получае­мых как на уровне целого теста, так и на уровне отдельных его пун­ктов.

Надежность целого теста имеет две разновидности.

1. Надежность-устойчивость (ретестовая надежность). Измеряется с помощью повторного проведения теста на той же выборке испыту­емых, обычно через две недели после первого тестирования. Для ин­тервальных шкал подсчитывается хорошо известный коэффициент корреляции произведения моментов Пирсона:

где х1i. - тестовый балл i-го испытуемого при первом измерении;

х2i. - тестовый балл того же испытуемого при повторном измерении;

n - количество испытуемых.

Оценка значимости этого коэффициента основывается на несколь­ко иной логике, чем это обычно делается при проверке нулевой гипо­тезы - о равенстве корреляций нулю. Высокая надежность достига­ется тогда, когда дисперсия ошибки оказывается пренебрежительно малой. 'Относительную долю дисперсии ошибки легко определить по формуле

 

                                                  (3.2.4)

 

Таким образом, для нас существеннее близость к единице, а не отдаленность от нуля. Обычно в тестологической практике редко уда­ется достичь коэффициентов, превышающих 0,8. При г = 0,75 отно­сительная доля стандартной ошибки равна . Этой ошиб­кой, очевидно, нельзя пренебречь. При такой ошибке эмпирически полученное отклонение индивидуального тестового балла от средне­го по выборке оказывается, как правило, завышенным. Для того что­бы выяснить «истинное» значение тестового балла индивида, приме­няется формула

                                           (3.2.5)

где  - истинный балл;           '

хi — эмпирический балл i-го испытуемого;

r - эмпирически измеренная надежность теста;

 - среднее для теста.

Предположим, испытуемый получил балл IQ по шкале Стэнфорда.-Бине, равный 120 нормализованным очкам, М = 100, г = 0,9. Тог­да истинный балл  = 0,9  120 + 0,1  100 =118.

Конечно, требование ретестовой надежности является коррект­ным лишь по отношению к таким психическим характеристикам ин­дивидов, которые сами являются устойчивыми во времени. Если мы создаем тест для измерения эмоциональных состояний (бодрости, тре­воги и т. д.), то, очевидно, требовать от него ретестовой надежности бессмысленно: у испытуемых быстрее изменится состояние, чем они забудут свои ответы по первому тестированию.

Для шкал порядка в качестве меры устойчивости к перетестиро­ванию используется коэффициент ранговой корреляции Спирмена:

,                                            (3.2.6)

 

где di — разность рангов /-го испытуемого в первом и втором ранго­вом ряду.                                        

С помощью компьютера определяется более надежный коэффи­циент ранговой корреляции Кендалла (1975).

2. Надежность- согласованность (одномоментная надежность).

Эта разновидность надежности не зависит от устойчивости, име­ет особую содержательную и операциональную природу. Простей­шим способ ее измерения состоите коррелировании параллельных форм теста (Анастази Д., 1982, кн. 1,с. 106). Чаще всего параллель­ные формы теста получают расщеплением составного теста на «чет­ную» и «нечетную» половины: к первой относятся четные пункты, ко второй - нечетные. По каждой половине рассчитываются суммар­ные баллы и между двумя рядами баллов по испытуемым определя­ются допустимые (с учетом уровня измерения) коэффициенты кор­реляции. Если параллельные тесты не нормализованы, то предпоч­тительнее использовать ранговую корреляцию. При таком расщеп­лении получается коэффициент, относящийся к половинам теста. Для того чтобы найти надежность целого теста пользуются формулой Спирмена - Брауна:

 

                                                    (3.2.7)

 

где rx - эмпирически рассчитанная корреляция для половин.

Делить тест на две половины можно разными способами, и каж­дый раз получаются несколько разные коэффициенты (Аванесов В. С., 1982, с. 122), поэтому в психометрике существует способ оценки син­хронной надежности, который соответствует разбиению теста на та­кое количество частей, сколько в нем отдельных пунктов. Такова фор­мула Кронбаха:

 

                                                 (3.2.8)

 

где а - коэффициент Кронбаха;

k- количество пунктов теста;

 - дисперсия по j-му пункту теста;

- дисперсия суммарных баллов по всему тесту.

 

Обратите внимание на структурное подобие формулы Кронбаха (3.2.2) и формулы Рюлона (3.2.8).

Несколько раньше была получена формула Кьюдера - Ричардсо­на, аналогичная формуле Кронбаха для частного случая - когда отве­ты на каждый пункт теста интерпретируются как дихотомические переменные с двумя значениями (1 и 0):

 

                                    (3.2.9)

где KR20 - традиционное обозначение получаемого коэффициента;

-дисперсия i-и дихотомической переменной, какой является

i-й пункт теста; р = , q = 1 - p

В 1957 г. Дж. Ките предложил следующий критерий для оценки статистической значимости коэффициента a:

 

                                          (3.2.10)

 

где  - эмпирическое значение статистики % квадрат с п-1 степе­нью свободы;

k - количество пунктов теста;

n - количество испытуемых;.

a - надежность.

Формулы (3.2.8) и (3.2.9) позволяют оценить взаимную согласо­ванность пунктов теста, используя при этом только подсчет диспер­сий. Однако коэффициенты а и KR2I> позволяют оценить и среднюю корреляцию между i-м и j-м произвольными пунктами теста, так как связаны с этой средней корреляцией следующей формулой:

 

                                              11)

 

где  - средняя корреляция между пунктами теста. Легко увидеть идентичность формулы (3.2.11) обобщенной формуле Спирмена - Бра­уна, позволяющей прогнозировать повышения синхронной надежно­сти теста с увеличением количества пунктов теста в k раз (Аванесов В. С., 1982, с. 121). Из этой формулы видно, что при больших k малое значение  может сочетаться с высокой надежностью. Пусть  = 0,1, a k =100, тогда по формуле (3.2.11)

 

Широкое распространение компьютерных программ факторного анализа для исследования взаимоотношений между пунктами теста (по одномоментным данным) привело к обоснованию еще одной до­статочно эффективной формулы надежности теста, которой легко воспользоваться, получив стандартную распечатку компьютерных результатов факторного анализа по методу главных компонент:

 

                                  (3.2.12)

 

где θ - коэффициент, получивший название тета-надежности теста;

k - количество пунктов теста;

λ1 - наибольшее значение характеристического корня матрицы

интеркорреляций пунктов (наибольшее собственное значение, или аб­солютный вес первой главной компоненты).

Как и предыдущие формулы, формула (3.2.12) также относится к оценке надежности теста, направленного на измерение одной характе­ристики. Но, кроме того, она применима и для многофакторного теста, хотя и нуждается в пересчете после первоначального отбора пунктов, релевантных фактору (после того, как на основании многофакторного анализа отобраны пункты по одному фактору, снова проводится фак­торный анализ - только для этих отобранных пунктов).

Надежность отдельных пунктов теста. Надежность теста обес­печивается надежностью пунктов, из которых он состоит. Чтобы по­высить ретестовую надежность теста в целом, надо отобрать из ис­ходного набора пунктов, апробируемых в пилотажных психометри­ческих экспериментах, такие пункты, на которые испытуемые дают устойчивые ответы. Для дихотомических пунктов (типа «решил - не решил», «да - нет») устойчивость удобно измерять с использованием четырехклеточной матрицы сопряженности:

Тест 1

 

      Да                Нет

a

B

c

D

Да                    Тест 2

Нет

 

Здесь в клеточке а суммируются ответы «Да», данные испытуе­мым при первом и втором тестировании, в клеточке b - число случа­ев, когда испытуемый при первом тестировании отвечал «Да», а при втором - «Нет» и т. д. В качестве меры корреляции вычисляется фи-коэффициент:

 

                                 (3.2.13)

 

Как известно, значимость фи-коэффициента определяется с по мощью критерия хи-квадрат:

 

                                              (3.2.14)

 

Если вычисленное значение хи-квадрат выше табличного с од­ной степенью свободы, то нулевая гипотеза (о нулевой устойчивос­ти) отвергается. Удобство использования фи-коэффициента состоит в том, что он одновременно оценивает степень оптимальности данного пункта теста по силе (трудности): фи-коэффициент оказывает­ся тем меньшим, чем сильнее частота ответов «да» отличается от частоты ответа «нет».

Кроме того, сама четырехклеточная матрица позволяет просле­дить возможную несимметричность в устойчивости ответов «да» и «нет» (это важнее для задач, чем для вопросов: например, может ока­заться, что все испытуемые, уже решившие однажды данную задачу, решают ее при повторном тестировании; это наводит на мысль о том, что при втором тестировании происходит сбережение опыта, приоб­ретенного при первом тестировании). Выявленные в результате тако­го анализа неустойчивые и неинформативные (слишком сильные или слишком слабые) пункты должны быть исключены из теста. Пункты следует считать недостаточно устойчивыми, если на репрезентатив­ной выборке величина превышает 0,71. При этом φ< 0,5.

Для т<?го чтобы повысить одномоментную (синхронную) надеж­ность теста, следует из исходной пилотажной батареи пунктов отбро­сить те, которые плохо согласованы с остальными[12]. В отсутствие ком­пьютера согласованность для пунктов также очень просто определяет­ся с помощью четырехклеточной матрицы. В этом случае в первом стол­бце суммируются ответы испытуемых из «высокой».группы (пр величине суммарного балла), во втором столбце - из «низкой».

 

     Высокая            Низкая

A

B

C

D

Да                 

Нет                

 

При нормальном распределении частот суммарных баллов «вы­сокая» и «низкая» группы отсекаются справа и слева 27%-ными мар­гинальными квантилями (рис. 8).

Для оценки согласованности с суммарным баллом применяется полная[13] или упрощенная формула фи-коэффициента:

 

                                          (3.2.15)[14]

 

где  - количество ответов «верно» («да») на i-й пункт теста;

N* - сумма всех элементов матрицы;

N* = n0,54 где n - объём выборки;

Pi = а + b - При включении в эстремальную группу 1/3 выборки

N* = 0,66 • n.

 

 Рис. 8. Квантили «высокой» и «низкой» группы на графике распределения тестовых баллов

 

В некоторых случаях подобный анализ позволяет уточнить ключ для пункта: если пункт получает значимый положительный фи-коэф­фициент, то ключ определяется значением «+1», если пункт получает значимый отрицательный фи-коэффициент значением «-1». Если пункт получает незначимый фи-коэфф.ициент, то его целесообразно исключить из теста.

При ручных вычислениях фи-коэффициента удобно вначале с помощью формул (3.2.14) и (3.2.15) определить граничное значение значимого (по модулю) фи-коэффициента. Например, при объеме выборки в 100 человек и уровне значимости р < 0,01 пороговое зна­чение вычисляется так:

 

                                (3.2.16)

 

При постоянном использовании компьютера при подсчете сум­марных баллов ключ для каждого пункта Q целесообразно опреде­лить в виде самого фи-коэффициента (или другого коэффициента корреляции), определенного при коррелировании ответов на пункт с сум­марным баллом. Тогда тестовый балл подсчитывается по формуле

 

                                               (3.2.17)

где хi — суммарный балл i-го испытуемого;

- ответ «верно» (+1) или «неверно» (-1) i-го испытуемого на i-й пункт;

Сi- ключ для i-го пункта: С = +1 для прямого, С= -1 для обрат­ного.

Более чувствительный коэффициент, который также применяет­ся для дихотомических пунктов, - это точечный бисериальный коэф­фициент корреляции, учитывающий амплитуду отклонения индиви­дуальных суммарных баллов от среднего балла:

 

                                                   3.2.18)

 

где x* - сумма финальных баллов тех индивидов, которые дали утвердительный ответ на i-й пункт теста (решили i-ю задачу);

Sx - стандартное отклонение для суммарных баллов всех индиви­дов из выборки;

 - стандартное отклонение по i-му пункту;

 - средний балл по всем пунктам.

А. Анастази относит критерий внутренней согласованности тес­та к валидности (Анастази А., 1982, кн. 1, с. 143), однако если и мож­но в данном случае говорить о валидности, то только в смысле осо­бой внутренней валидности теста. Как правило, слишком высокая со­гласованность снижает внешнюю валидность теста по критерию (см. раздел 3.3). Если проверяется согласованность пунктов, составлен­ных одним автором (одним коллективом по стандартной инструкции), то выявление достаточного набора согласованных пунктов свидетель­ствует о внутренней валидности (согласованности) разработанного диагностического понятия (конструкта).

В компьютерных данных факторного анализа аналогом корреля­ции пункта с суммарным баллом является нагрузка пункта на веду­щий фактор («факторная валидность» в терминах А. Анастази). Если прибегать к геометрическому изображению нагрузки как проекции вектора-пункта на ось-фактор, то структура пунктов хорошо согласо­ванного теста предстанет в виде пучка векторов, плотно прилегаю­щих к фактору и вытянувшихся вдоль его оси (рис. 9).

 

 

 

Рис. 9. Векторная модель соотношения «прямых» и «обратных» эмпирических пунктов с релевантным (измеряемым) фактором и иррелевантными («шумовыми») факторами

 

Последовательность действий при проверке надежности:

1.  Узнать, существуют ли данные о надежности теста, предпо­лагаемого к использованию, на какой популяции и в какой диагнос­тической ситуации проводилась проверка. Если проверки не было или признаки новых популяции и ситуации явно специфичны, про­вести заново проверку надежности с учетом указанных ниже воз­можностей.

2.  Произвести повторное тестирование на всей выборке стан­дартизации и подсчитать все коэффициенты, как для целого теста, так и для его отдельных пунктов. Анализ полученных коэффициен­тов позволит понять, насколько пренебрежима ошибка измерения, дает ли данный тест интервальную шкалу (высокий r) или только диагностичен для крайних групп (высокий φ), насколько устойчиво измеряемое свойство во времени (возможен ли статистический про­гноз - проекция тестового балла на будущее), в каких своих пунк­тах тест менее надежен (анализ этих пунктов позволяет психологи­чески осмыслить содержательный механизм взаимодействия пунк­тов с испытуемыми).

3. Если возможности обследования испытуемых ограниченны, произвести повторное тестирование только на части выборки (не ме­нее 30 испытуемых), подсчитать (вручную) ранговую или четырех-клеточную корреляцию для оценки внутренней согласованности и ста­бильности теста в целом.

 

3.3. ВАЛИДНОСТЬ ТЕСТОВ

 

Проблемы валидизации психологических тестов являются цент­ральными для дифференциальной психометрики, но, к сожалению, до сих пор решенными не до конца. Решение этой проблемы зависит не от статистического аппарата, а от уровня развития теоретического аппарата дифференциальной психологии.

Валидность и надежность. Валидность (или обоснованность) всякой процедуры измерения состоит в однозначности (устойчивос­ти) получаемых результатов относительно измеряемых свойств объек­тов, т, е. относительно предмета измерения. Отличие понятия валидности от надежности измерения удобно раскрывать с помощью раз­личения «объекта» и «предмета» измерения. Надежность - это устой­чивость процедуры относительно объектов. Надежность не обязательно предполагает валидность. В психологии довольно часто возникает такая ситуация, когда исследователь вначале предлагает определенную процедуру измерения, показывает ее надежность -способность устойчиво различать объекты, но вопрос о валидности остается открытым.

Если в сенсорной психофизике вопрос о валидности измерений оказывается в значительной степени затушеванным тем обстоятель­ством, что простейшие физические стимулы достаточно однозначно детерминируют измеряемые свойства ощущений, то в дифференци­альной психометрике значимость проблемы валидности резко возра­стает. Здесь ситуация подобна той, когда в психофизическом опыте испытуемому не указывают, по какому именно параметру следует срав­нивать стимулы. Пусть испытуемый А понял инструкцию так, что стимульные объекты надо сравнивать по весу, а испытуемый Б - по раз­меру. Если процедура измерения будет повторена по отношению к тем же объектам, то она даст вполне устойчивые данные относитель­но объектов, но не даст валидной информации ни о шкале ощущений «веса», ни о шкале ощущений «размера».

При измерении способностей предъявляемый тест отнюдь не обя­зательно актуализирует именно тот психический процесс, который предполагается измерить. Например, столкнувшись с уже встречав­шейся однажды задачей (например, с анаграммой «дзиканпр»), испы­туемый может начать запоминать просто то решение, к которому он уже однажды пришел (слово «праздник»), чем заново решать эту за­дачу. Здесь будет измеряться скорее уровень словесной памяти, чем уровень вербального интеллекта. Точно так же реальная валидность некоторых тестов раскрывается только в результате значительного опыта работы с ними. Например, доказано, что ряд тестов, внешне вы глядящих интеллектуальными, на деле измеряют скорее личностно-стилевые особенности индивида, чем операциональные возмож­ности интеллекта, например, методика «креативного поля» Д. Б. Бо­гоявленской.

Устойчивость теста относительно объектов (испытуемых) явля­ется необходимым, но не достаточным условием его устойчивости относительно измеряемых атрибутов (свойств) объектов. Надежность является необходимым, но не достаточным условием валидности. Отсюда вытекает основное соотношение психометрики:            

 

валидность ≤ надежность.

 

Это означает, что валидность теста не может превышать его надеж­ность.      

Данное соотношение, однако, неверно трактовать как указание на прямую пропорциональную связь валидности и надежности. По­вышение надежности отнюдь не обязательно приводит к повышению валидности[15]. В терминах А. Анастази валидность определяется ре­презентативностью теста относительно измеряемой области поведе­ния. Если эта область поведения складывается из разнообразных фе­номенов, то содержательная валидность теста автоматически требует представленности в нем моделей всех этих разнообразных феноме­нов. Возьмем глобальное понятие «речевая способность» (этому психолингвистическому термину в традиционной тестологии соответству­ет термин «вербальный интеллект»). Сюда относятся такие относи­тельно независимые друг от друга навыки, как навыки письма и чте­ния. Если заботиться о содержательной валидности соответствую­щего теста, то нужно ввести в него группы заданий на проверку этих довольно разных по своему операциональному составу компонентов вербального интеллекта. Вводя разнородные пункты и субшкалы (суб­тесты), мы обязательно сокращаем внутреннюю согласованность, од­номоментную надежность теста, но зато добиваемся существенного повышения валидности. Таким образом, для расширения области при­менения теста психодиагност должен избегать излишнего повыше­ния внутренней согласованности. Одновременно с этим снижением внутренних корреляций между различными пунктами теста (об этом уже говорилось в разделе 3.1) обязательно исчезает отрицательный эксцесс на кривой распределения тестовых баллов, и она все более приближается по форме к нормальной кривой.

Эмпирическая валидность. Если в случае с содержательной ва-лидностью оценка теста производится за счет экспертов (устанавли­вающих соответствие заданий теста содержанию предмета измере­ния), то эмпирическая валидность измеряется всегда с помощью ста­тистического коррелирования: подсчитывается корреляция двух ря­дов значений - баллов по тесту и показателей по внешнему параметру, избранному в качестве критерия валидности.

Прагматические традиции западной тестологии привязывали эм­пирическую валидность теста к внешним для психологии социально-прагматическим критериям. Эти критерии являются показателями, обладающими непосредственной ценностью для определенных об­ластей практики. Практика всегда имеет целью либо повысить, либо понизить эти показатели. Например, в области педагогической пси­хологии это «успеваемость» (которую надо повысить), в психологии труда это «производительность труда» и «текучесть кадров», в меди­цине - «состояние здоровья пациента», в психологии управления -«совместимость», «срабатываемость» коллектива, в юридической пси­хологии - «преступность» (которую надо понизить) и т. п.

Ориентируясь непосредственно на эти категории, психолог, пы­тающийся скоррелировать результаты теста с этими показателями, фактически решает сразу две задачи: задачу измерения валидности и задачу измерения практической эффективности своей психодиагнос­тической программы. Если получен значимый коэффициент корреля­ции, то можно считать, что решены с позитивным результатом сразу обе эти задачи. Но если корреляции не обнаружено, то остается нео­пределенность: либо невалидна сама процедура (тестовый балл не отражает, например, стрессоустойчивость оператора), либо неверна гипотеза о наличии причинно-следственной связи между психичес­ким свойством и социально значимым показателем (стрессоустойчивость не влияет на процент аварийных ситуаций).

Таким образом, социально-прагматические критерии являются комплексными: они позволяют измерить валидность-эффективность, но не каждое из этих двух свойств теста отдельно. На практике пси­холога часто ожидает и еще более сложная ситуация, когда заказчик требует от психолога на основании полученного диагноза сразу же определенных мер по вмешательству в ситуацию (отбор, консульти­рование, обучение и т. п.). В этом случае повышение показателей (достоверное по сравнению с контрольной группой) доказывает од­новременно и валидность-эффективность диагностики, и эффектив­ность самого вмешательства. А отрицательный результат дает еще большую неопределенность, так как оказывается невозможным от­делить неэффективность вмешательства от низкой валидности ди­агностики.

Ориентация на социально-прагматические критерии, приводящие к склейке понятий «валидности измерения» и «причинного прогноза по результатам измерения», бесспорно, сдерживала и продолжает сдер­живать развитие концептуального аппарата дифференциальной пси­хологии. При этом суть самого предмета измерения: измеряемого пси­хического свойства - оказывается вне фокуса внимания не только заказчика, но и самого психолога, превращающегося в этом случае в тестолога, которого не интересует, что именно он измеряет, главное лишь, чтобы от этого «нечто» перекидывался мостик к полезному эффекту, обеспечивающему психологу социальное признание.

Процедура эмпирической валидизации. Организация выборки при эмпирической валидизации зависит от временного статуса критерия. Если этот критерий - событие в прошлом (ретроспективная валидизация), то к участию в психодиагностическом обследовании доста­точно привлечь только тех испытуемых, которые оказались на экстремальных полюсах по этому критерию[16]. В результате применяется ме­тод экстремальных (контрастных) групп. Коррелирование с суммар­ным баллом по тесту оценивается с помощью бисериального коэф­фициента по формуле (3.2.17). При этом в статусе дихотомической переменной (на месте отдельного пункта) оказывается сам критерий валидности: x— сумма баллов по тесту, полученных «высокой» груп­пой по критерию; - стандартная ошибка критерия, связанная с численностью «высокой» (р) и «низкой» (q) групп.

Если критерий - будущее событие (проспективная валидизация), то выборка должна быть составлена с запасом - с учетом вероятного объема экстремальных групп в будущем. Например, нужно выяснить, позволяет ли диагностика темперамента прогнозировать повышен­ный риск психосоматических заболеваний (гипертония, язва, астма и т. п.). Пусть на основании эпидемиологических исследований извес­тно, что в течение трех лет из. 1000 здоровых людей этими болезнями заболевают 57 человек. Это означает, что превентивной (предупреж­дающей) диагностикой должно быть охвачено около 2000 человек, чтобы получить численность «высокой» группы (заболевших) поряд­ка 100 человек. Проспективная валидизация выявляет прогностичес­кую эффективность диагностической процедуры. Высокая прогнос­тическая валидность доказывает как валидность самого измерения, так и наличие предполагаемой причинной связи.

Ретроспективная валидизация позволяет в лучшем случае решить только первую из двух задач. Например, если для исследования лич­ностной предрасположенности к совершению краж проведено обсле­дование лиц, находящихся под следствием (т. е. уже совершивших преступление), то выявление акцентированных черт «тревожности», «агрессивности» и т. п. еще не может интерпретироваться как свиде­тельство причинных факторов преступности - эти черты могут быть лишь следствием сложившихся обстоятельств: лишение свободы, уг­рызения совести и т. п. (Ратинов А. Р., 1979). Во многих медико-пси­хологических исследованиях был выделен особый диагностический синдром «госпитализации», который обнаруживается у любой кате­гории госпитализированных больных (обычно он выражается в по­вышении шкал «депрессии» и «ипохондрии» по MMPI – Шхвацабая,  1980). Очевидно, что подобные личностные сдвиги никак нельзя ин­терпретировать в смысле симптомов предрасположенности к опреде­ленным психогенным заболеваниям, ибо они относятся к следстви­ям, а не к причинам этих заболеваний.

Конструктная валидность. В отличие от прагматической валидизации собственно психологическую валидизацию порой оказыва­ется провести гораздо труднее в силу отсутствия какого-либо более объективного внутрипсихологического критерия, чем сам тест.

Наиболее благополучная ситуация имеется тогда, когда для из­мерения данного свойства в психологии уже имеется процедура с известной валидностью. В этом случае корреляция между балла­ми двух тестов - линейная (см. формулу 3.2.3) или ранговая (см. формулу 3.2.5)- указывает на то, обладает ли новый тест конвер­гентной валидностью по отношению к старому. Если новый тест обнаруживает высокую конвергентность результатов со старым и одновременно оказывается более компактным и экономичным 'в проведении и подсчете, то психодиагносты получают возможность использовать новый тест вместо старого.

Однако во многих случаях для измеряемого свойства психодиа­гност не может найти в литературе ни одного уже апробированного теста с известной валидностью. В этом случае он может сформулиро­вать ряд предсказательных гипотез о том, как будет коррелировать его новый тест с другими тестами, измеряющими родственные характеристики испытуемых. Эти гипотезы выдвигаются на основе теоретических представлений об измеряемом свойстве. Их подтвержде­ние указывает на валидность выдвигаемого конструкта, т. е. на конструктную валидность теста. В западной литературе это операциональное определение конструктяой валыидности называется предполага­емой валидностью (assumed validity).                                                 

Представления о конструктной валидности тестов постоянно развиваются с пополнением репертуара методик. Эмпирические иссле­дования взаимосвязей результатов, получаемых с помощью разных методик, обогащают теоретические представления об измеряемых свойствах.                                           

С другой стороны, понятие конструктной валидности указывает на высокую зависимость эмпирических связей теста от теоретичес­ких представлений его автора об измеряемом свойстве. Для иллюст­рации приведен пример взаимоотношений между двумя популярны­ми тест-опросниками: MAS Ж. Тейлор и EPI Г. Айзенка. Многочис­ленные корреляционные исследования, проведенные на репрезента­тивных выборках, показали, что шкала MAS (тревожность) Ж. Тейлор положительно коррелирует со шкалой «нейротизм» и отрицательно со шкалой «экстраверсия» Айзенка. Эти соотношения можно проил­люстрировать графически (рис. 10): вектор MAS оказывается распо­ложенным в квадранте «Нейротизм - Интроверсия», образованном си­стемой из ортогональных (статистически независимых) факторов EPL С точки зрения концепции Г. Айзенка, эти данные можно рассмат­ривать как свидетельства низкой валидности шкалы Ж. Тейлор: MAS коррелирует не только с релевантным фактором «нейротизм», но и с иррелевантным фактором «интроверсия». С этой точки зрения, оп­росник EPI оказывается просто нечувствительным к особой разно­видности «нейротизма» - к нейротизму (тревожности) экстравертов; в перечне пунктов MAS отсутствуют высказывания, в которых могла бы проявиться тревожность экстраверта. Однако с точки зрения тоготеоретического смысла, который приписывают показателям MAS К. Спенс и Ж. Тейлор, эта ситуа­ция вполне закономерна, жела­тельна и никак не является арте­фактом - следствием дефекта их диагностического средства. Со­гласно К. Спенсу, пытавшемуся перенести на человеческое пове­дение теорию научения Халла, MAS измеряет общий уровень драйва - неспециализированного побуждения, которое достигает максимума как раз при сочетании нейротизма (специфическая ак­тивация по Г. Айзенку) и интро-версии (неспецифическая активация)

 

 

Рис. 10. Векторная модель соотношения показателя «Тревожность» по тест-опроснику MAS с факторами тест-опросника EPI

 

Таким образом, вовсе не всегда краткие названия тестов од­нозначно выражают теоретический статус диагностического конст­рукта - понятия об измеряемом свойстве.

Конвергентная и дискриминантная валидность. От того, как пси­холог определяет диагностический конструкт, зависит стратегия вклю­чения в тест определенных пунктов. Если Айзенк определяет свой­ство «нейротизм» как независимое от экстраверсии-интроверсии, то это означает, что в его опроснике примерно поровну должны быть представлены пункты, с которыми будут соглашаться невротичные интроверты и невротичные экстраверты (векторы этих пунктов дол­жны быть примерно поровну распределены в правом и левом нижних квадрантах; см. рис. 10).-Если же на практике окажется, что в тесте будут преобладать пункты из квадранта «Нейротизм-Интроверсия», то, с точки зрения теории Айзенка, это означает, что фактор «нейро­тизм» оказывается нагруженным иррелевантным фактором - «интроверсией». (Точно такой же эффект возникает, если появится перекос в выборке - если в ней будет больше невротичных интровертов, чем невротичных экстравертов.)

Для того чтобы не сталкиваться с такими сложностями, психо­логи хотели бы иметь дело с такими эмпирическими показателями (пунктами), которые однозначно информируют только об одном факторе. Но это требование реально никогда не выполняется: вся­кий эмпирический показатель оказывается детерминированным не ; только тем фактором, который нам нужен, но и другими - иррелевантными задаче измерения (рис. 11).

На рис. 11 постоянным для всех показателей является релевант­ный фактор А, но каждый раз он оказывается сопряжен с иррелевант-ными факторами - X, К и Z. Задача состоит в таком подборе пунктов,

 

чтобы все потенциальные иррелевантнв!е факторы были уравнове­шены, т. е. чтобы ни один из них не встречался бы чаще других на множестве показателей (пунктов), включенных в тест.

 

Рис, 11. Связь эмпирических показателей П1, П2, П, с релевантным (измеряемым) фактором А и с иррелевантными («шумовыми») факторами X, Y, Z, обусловливающими невалидность показателей

 

Таким обра­зом, по отношению к факторам, которые концептуально определяют­ся как ортогональные к измеряемому (встречающиеся с ним во всех комбинациях), составитель теста должен при отборе пунктов приме--нить стратегию искусственного балансирования (Готтсданкер Р., 1982);

Соответствие пунктов измеряемому фактору обеспечивает конвергентную валидность теста. Сбалансированность пунктов относи­тельно иррелевантных факторов обеспечивает дискриминантную валидностъ. Эмпирически она выражается в отсутствии значимой кор­реляции с тестом, измеряющим концептуально независимое свойство.

С точки зрения теории Айзенка, тест Ж. Тейлор не обладает дискриминантной валидностью по отношению к факторам «экстраверсия-интроверсия», хотя и обладает определенной конвергентной ва­лидностью по отношению к релевантному фактору - «нейротизм».

Экспертная эмпирическая валидизация. В отсутствие какого-либо уже валидизированного теста, параллельно измеряющего изучаемое свойство, а также в отсутствие разработанного теоретического кон­текста, позволяющего проверять конструктную валидность; психодиагност оказывается перед необходимостью привлечения экс­пертов к валидизации теста. В отличие от экспертного анализа содер­жания теста., эмпирическая экспертная валидизация предполагает ра­боту экспертов не с тестом (лучше, чтобы о нем эксперты вообще ничего не знали), а с испытуемыми из выборки стандартизации.

Необходимо экспертам обеспечить стандартные условия для на­блюдения за испытуемыми. Но не всегда такое стандартизованное на­блюдение удается организовать. Даже если предприняты серьезные усилия по организации наблюдения за поведением испытуемых в ка­кой-либо искусственной лабораторной ситуации, такое наблюдение все равно будет значительно уступать по информативности полевому наблюдению - в естественных условиях. Если измеряемое свойство теоретически определено как устойчивая универсальная черта лич­ности - как диспозиция к инвариантному поведению в широком спек­тре ситуаций (см. главу 4), то и отдельного полевого наблюдения ока­жется недостаточно для получения полноценного экспертного критерия валидности.

Поэтому на практике часто прибегают к оценкам особого типа -к субъективным оценкам, которые выносят испытуемому люди из его круга, имеющие опыт реального общения с ним. С учетом этого, про­цедура оценивания приспосабливается к обычным людям, не являю­щимся психологами. На психолога падает большая нагрузка по со­ставлению детальной инструкции оценщикам, однозначно задающей смысл оцениваемой характеристики. Лучшие условия для такой процедуры возникают при наличии группы испытуемых, тесно общаю­щихся между собой; тех, которые могут одновременно побывать и испытуемыми по отношению к тесту, и оценщиками по отношению друг к другу. В отечественной литературе эта процедура получила со­кращенное обозначение ГОЛ - «групповая оценка личности» (Кузь­мин Н. В., Семенов В. С., 1977).

Для того чтобы групповая оценка личности была источником дей­ствительно валидной информации, оценщики должны согласованно оценивать испытуемых. Если в оценках разных оценщиков нет согла­сованности, то это означает, что либо оцениваемое свойство не про­явилось у объекта оценивания, либо оценщики по-разному проинтерпретировали инструкцию. Для измерения согласованности должна быть составлена таблица с оценками (табл. 6).

Таблица 6

 

Оценщики

Испытуемые

О1

О2

Оk

И1

x11

x12

x1k

C1

И2

x21

x22

 

x2k

C2

 

 

 

 

 

Иn

xn1

xn2

 

xnk

Cn

 

Методы анализа данных, содержащихся в такой таблице, формаль­но совершенно эквивалентны тем методам, которые применяются для обработки таблиц «испытуемые - пункты» (см. раздел 3.1), В частно­сти, суммы по строкам дают суммарные баллы, полученные каждым испытуемым у всех оценщиков. Таким образом, оценщики в данном случае оказываются формально в роли пунктов теста. Рассчитывая попарные корреляции между различными столбцами этой таблицы, можно получить коэффициенты согласованности для отдельных пар оценщиков. Глобальной мерой согласованности оценщиков может служить коэффициент надежности а Кронбаха - см. формулу (3.2.8).

Если же групповая оценка не обнаруживает надежности, то она не может использоваться в качестве критерия валидизации при про­верке валидности теста.

Эмпирическое значение коэффициента валидности рассчитыва­ется как линейная или ранговая корреляция между двумя рядами зна­чений: тестовыми баллами и суммарными баллами экспертной оцен­ки. Это эмпирическое значение при наличии невысокого коэффици­ента надежности критерия корректируют по формуле

                                                     (3.3.1)

 

где  - эмпирическая корреляция с критерием;

ас — надежность критерия;

rtx - корреляция с «истинным» критерием («истинная» валидность теста).

Анализ пунктов по критерию валидности. Валидность всего тес­та целиком зависит от валидности входящих в него пунктов. Макси­мальная валидность достигается за счет отбора таких пунктов из пи­лотажной батареи, которые, обладая значимой корреляцией с крите­рием, минимально коррелируют между собой. Отбор пунктов имен­но по критерию валидности обеспечивает максимальную прагматическую эффективность теста. Вручную (на калькуляторе) та­кой отбор можно произвести, рассчитав бисериальную корреляцию (или фи-корреляцию) критерия с каждым пунктом из пилотажной батареи, - см. формулы (3.2.15) и (3.2.17). Компьютер позволяет ис­пользовать более эффективный алгоритм, основанный на анализе ча­стных корреляций между критерием и пунктами и предполагающий построение уравнения множественной регрессии (Аванесов В. С., 1982, с. 153-157). В результате в таком уравнении каждый пункт по­лучает весовой коэффициент[17], количественно выражающий его вклад в критерий, не сводимый к вкладу других пунктов, т. е. поиск опти­мального набора пунктов автоматизируется. X. Гаррет приводит сле­дующую яркую иллюстрацию эффективности алгоритма, позволяю­щего подобрать оптимальный набор пунктов. Пусть имеется 20 пунк­тов, каждый из которых имеет корреляцию с критерием порядка 0,30. Оказывается, если эти пункты в среднем коррелируют друг с другом на уровне  = 0,60, то множественная корреляция суммарного тесто­вого показателя с критерием равняется 0,38, если же га = 0,30, мно­жественная корреляция повышается до 0,52. Наконец, при rtj= 0,10

эффективность (валидность) теста достигает весьма высокого уров­ня: 0,79. Те же самые проблемы возникают при подборе оптимальной батареи тестов, направленных на прогнозирование какого-то одного социально ценного показателя (успеваемость, производительность труда и т. п.).

Как уже указывалось в разделе 3.1, тест, обладающий высокой критериальной валидностью должен давать монотонную зависимость величины критерия от тестового балла (см. рис. 6). Для того чтобы получить монотонную линию регрессии, психодиагност должен вклю­чить в тест X только такие пункты, которые являются валидными по критерию С. В противном случае на кривой неминуемо появятся про­валы[18]. Крутизну линии регрессии можно существенно повысить за счет нацеленного отбора из первоначальной батареи только таких за­даний, которые обладают значимо высокой корреляцией (или регрес­сионным коэффициентом в уравнении множественной регрессии) с критерием.

После отбора валидных пунктов должна быть произведена пере­крестная валидизация (см. Анастази А., 1982, с. 197). В чем ее смысл? Если при анализе корреляций между батареей из 200 заданий и ка­ким-то критерием получают 10 заданий, значимо коррелирующих е критерием на уровне ошибки р < 0,05, то это может быть следствием чисто случайного совпадения (сравните 10/200=0,05). Чтобы убедиться в том, что отобранные пункты теста действительно могут различать (или прогнозировать) критерий, нужно рассмотреть, как коррелиру­ют с критерием эти пункты на другой выборке, которая не использо­валась при их отборе.

Простой метод реализации принципа перекрестной валидизации состоит в том, что вся выборка делится на две случайные половины и производится раздельный расчет корреляций пунктов с критерием для-. каждой половины выборки. Если выделенные (значимые) пункты совпадают, то перекрестную валидизацию можно считать удачной.

Метод критериального тестирования очень трудоемок. .Прак­тически невозможно построить критериальный тест за счет одной статистики, сколь бы мощными выборками и батареями заданий мы ни располагали. Необходима работа над содержательной валидностью заданий. Критериальное тестирование имеет ограни­ченное применение в задачах построения методик с широкой областью применения.

Следует еще раз подчеркнуть, что анализ валидности отдельных пунктов служит не только прагматическим целям, но может и должен служить целям углубления представлений о содержательно-теоретическом смысле измеряемого свойства: на основании содержательно­го анализа пунктов, отобранных по критерию, психолог уточняет и корректирует свою первоначальную теоретическую схему, свое по­нимание измеряемого свойства.

Достоверность самоотчета. Рассматривая общую проблемы валидности целесообразно выделить вопрос об обеспечении ва­лидности процедур стандартизованного самоотчета. Сюда относят­ся различные техники шкалирования, классифицирования, срав­нения и тест-опросники. Вербальная форма тестового материала порождает у испытуемого определенные встречные гипотезы о цели тестирования. Если ситуация диктует испытуемому необходимость фальсификации ответов, то он редко отказывается от этой возмож­ности.

Валидность — характеристика любых измерений, в том числе и физических. Специфические проблемы валидности, связанные с актив­ностью человека как объекта психодиагностики, целесообразно обозначить особым образом - проблемы обеспечения достоверности.

Психологические факторы, от которых зависит достоверность са­моотчета, условно можно сгруппировать в следующие классы:

1.  Факторы знания. У испытуемого может быть более или менее четкое представление о следующем: а) свойственно ли ему в действи­тельности или нет тестируемое поведенческое проявление (с некото­рыми ситуациями, имплицитно подразумеваемыми в вопросе тест-оп­росника, испытуемый мог на практике никогда не встречаться: напри­мер, утверждение «После выигрыша в спортлото Вы покупаете боль­ше лотерейных билетов» подразумевает, что испытуемый, во-первых, играет в спортлото и, во-вторых, выигрывает); б) какое личностное свой­ство скрывается у психолога за тем или иным конкретным поведением, описанным в суждении; в) как это свойство соотносится с общеприня­тыми моральными нормами и признаками социального успеха.

2.  Фактор социальной желательности. Обозначает тенденцию испытуемого давать о себе социально одобряемую информацию. Сила этой тенденции зависит как от общей внеситуативной установки испы­туемого на морализацию «Я-образа» и социальную успешность, так и от того, насколько эту установку актуализирует сама ситуация тестиро­вания. Однако эта тенденция не будет давать систематического искаже­ния, если испытуемые не смогут разгадать направленность теста-оп­росника и связать диагностируемое свойство с тем или иным полюсом социальной желательности. Таким образом, действие этого фактора до некоторой степени опосредовано действием факторов знания. Однако при диагностике личностных свойств, тесно связанных с психической «нормальностью» или «социальной успешностью», фактор социальной желательности ответа обусловливает очень серьезные искажения.

3.  Факторы индивидуальной тактики. Здесь подразумевается действие «Я-концепции» («Я» для себя) и «Я-образа» («Я» для дру­гих) на ситуативную тактику испытуемого в момент тестирования. Выполняя тест, испытуемый всегда находится в невольном диалоге с самим собой и в своих ответах на вопросы раскрывает себя не только для других, но и для себя самого. Испытуемый стремится подтвер­дить «Я-концепцию» или фальсифицировать определенный «Я-образ» с заданными свойствами. Как правило, в ситуациях высокого соци­ального риска «Я-образ» полностью доминирует: например, преступ­ник при экспертизе стремится прежде всего предстать больным или неприспособленным к жизни, хотя в действительности ему было бы приятно думать о себе как о вполне адаптированном здоровом чело­веке. Точно так же склонны подчеркивать свои трудности и проблемы клиенты, обратившиеся за помощью к психологу или психотера­певту (чтобы вызвать к себе его повышенное внимание). В менее рег­ламентированных ситуациях, наоборот, может доминировать мотива­ция самопознания: в этом случае испытуемый невольно стремится подтвердить с помощью теста свои гипотезы о самом себе.

Заслуживают внимания и особые формы отказа испытуемого от тестирования: позиционный стиль ответа (соглашательство или, на­оборот, отрицание), случайные ответы. Для выявления подобных от­казов обычно достаточно довольно простых мер: 1) для исключения влияния соглашательства (отрицания) применяются перечни с «пря­мыми» (ответ «верно» в пользу измеряемого свойства) и «обратны­ми» (ответ «неверно» в пользу измеряемого свойства) пунктами. Кро­ме того, производится подсчет баланса подтверждающих и отверга­ющих ответов: если баланс резко нарушается, то протокол признает­ся бракованным; 2) для выявления случайных ответов в большие перечни вводят вопросы-дубли (синонимические перефразы) или пря­мые повторы: если испытуемый слишком часто по-разному отвечает на одинаковые вопросы, значит, он применяет случайную тактику. Вводят также и крайне редкие утверждения, с которыми испытуемые, как правило, соглашаются только по ошибке.

Более изощренные методы требуются для борьбы с социальной желательностью. Ниже рассмотрены три наиболее часто используе­мых варианта.

1.  Введение особых «шкал лжи» в диагностический вариант методики. Они составляются из вопросов-ловушек: тот или иной ответ на эти вопросы явно предопределен социальной желательностью. Если испытуемый набирает слишком высокий балл по этой шкале, его протокол бракуется. Более тонкий вариант — введение «шкал коррекции» (например, в MMPI): получение определенного балла по этим шкалам вызывает внесение поправок к баллу по другим шкалам, скоррелированным со шкалой коррекции. Величина поправок определяется коэффициентом линейной регрессии (измеренным в нормативном эксперименте) между баллами, полученными по шкале коррекции и основной диагностической шкале (шкале свойства).

2. Устранение или сбалансирование социальной желательности с помощью использования инструкции на преднамеренную фальсификацию результатов. Участникам пилотажных замеров кроме обычной инструкции дается дополнительная (во вторую очередь): «Заполните опросник от лица человека, желающего произвести самое благопри­ятное впечатление». Затем производится отбор пунктов на основании того, насколько процент ответов на них отличается от 50 процентов (значение, ожидаемое для пунктов, являющихся нейтральными с точ­ки зрения социальной желательности).

В качестве меры желательности в данном случае можно восполь­зоваться следующим коэффициентом:

 

                                    (3.3.2)

 

где N (+) — сумма ответов «верно» на данный пункт при инструкции на фальсификацию;

N (-) - сумма ответов «неверно» в тех же условиях;

n - объем выборки.

Значимость коэффициента приближенно оценивается по крите­рию «хи-квадрат», определенному формулой (3.2.14), которой в пра­вой части вместо φ подставляется.

Поскольку инструкция на преднамеренную фальсификацию соз­дает условия, в которых социальная желательность суждений акцен­тируется, то значимыми следует считать такие высокие по модулю значения  при которых , превышает теоретическое значение  для квантиля

р < 0,001. Из таблицы для распределения «хи-квад­рат» находим  =10,83. Таким образом, при наличии выборки объе­мом 50 человек . Это означает следующее: если

на i пункт более чем 36 испытуемых из 50 ответили «верно», то его нужно отнести к положительному полюсу шкалы социальной жела­тельности, если менее чем 14 ответили «верно» — к отрицательному. Такие пункты должны быть либо полностью исключены из опросни­ка (что редко удается), либо количество положительных и отрицатель­ных пунктов должно быть уравновешено.

Таким образом могут быть отобраны и пункты для шкалы лжи. Суммарный балл по этой шкале распределяется так, как показано на рис. 12. В качестве критерия разделения испытуемых выбирается критическая точка, которая позволяет минимизировать ошибки типа «про­пуск» (зачисление лживых испытуемых в число правдивых) и ошиб­ки типа «ложная тревога» (зачисление правдивых в число лживых). Положение критической точки на шкале можно менять в зависимос­ти от баланса цены двух типов ошибок: в некоторых случаях «про­пуск» гораздо опаснее, чем «ложная тревога».

 

 

Рис. 12. Смещение распределения тестовых баллов по «шкале лжи» к   полюсу высоких значений X при инструкции на выполнение теста-опросника с позиции «идеального» человека

 

Фальсифицирующая инструкция используется также и для иссле­дования степени «скрытности-открытости» формулировок вопросов. Например, испытуемым дается инструкция на симуляцию высокой тревожности по опроснику MAS Ж. Тейлор. В этом случае, как это уже было показано, ответы на многие пункты значимо изменяются. Такие пункты являются слишком открытыми — они информируют испытуемого об измеряемом свойстве и позволяют ему вносить тен­денциозные искажения в результаты в своих интересах.

3. С распространением факторного анализа чаще стала приме­няться стратегия «балансирования социальной желательности». При этом исследователь-психометрист задается целью обеспечить дискриминативную валидность своего теста относительно шкалы «соци­альной желательности». Это достигается с помощью факторного ана­лиза корреляций между пунктами. Факторный анализ в применении к одномерному тесту-опроснику, как правило, выделяет два фактора: относящийся к самому измеряемому свойству и относящийся к соци­альной желательности. На рис. 13 схематически представлено фак­торное пространство для опросника «Склонность к риску».

 

 

Рис. 13. Иллюстрация рассеяния векторов (., изображающих пункты теста-опросника в пространстве двух факторов: релевантного и иррелевантного. Выше и ниже штриховых линий - области низкой достоверности

 

Каждый вопрос представлен вектором, задаваемым проекцией на релевантный фактор - Склонность к риску и иррелевантные «Социаль­ное одобрение» и «Социальное порицание». Требование конвергент­ной валидности по отношению к измеряемому свойству формулирует­ся как требование к пунктам - иметь высокую проекцию (нагрузку) на горизонтальную ось. Дискриминативная валидность по отношению к социальной желательности - это требование иметь пренебрежимо ма­лую нагрузку на вертикальную ось. Очевидно, имеются два способа устранить эффект социальной желательности: либо выкинуть все пун­кты, нагруженные фактором социальной желательности (выше или ниже штриховых линий, либо уравновесить их количество на полюсах соци­альной желательности.

Понятно, что при таком способе освобождения от социальной же­лательности диагностическая шкала всегда оказывается так называе­мой «ß-шкалой», в отличие от «а-шкал», у которых максимум жела­тельности достигается на одном из полюсов, у «ß-шкал» максимум желательности достигается в «золотой середине», т. е. линия регрес­сии желательности по «бетта-шкале» оказывается криволинейной (рис. 14). Если применить такой метод к построению опросника «Склон­ность к риску - Осторожность», то в результате диагностический кон­структ автоматически становится «бета-шкалой»: и слишком высокая склонность к риску, и излишняя осторожность - одинаково нежелатель­ны, тогда как оптимум лежит посередине между крайностями.

 

 

Рис. 14. Схематическая иллюстрация «-шкалы, связанной с фактором социальной желательности монотонной зависимостью, и ß-шкалы, связанной с этим фактором криволинейно – с максимумом в области «золотой середины»

 

Из трех перечисленных выше методов первый относится к отсеву испытуемых и требует введения в перечень вопросов для шкалы «лжи». Второй и третий методы позволяют отобрать только такие пункты, ко­торые обеспечивают устранение социальной желательности. Но они, как правило, трансформируют сам конструкт, который обязательно ста­новятся ортогональным к социальной желательности. При необходи­мости диагностирования свойств, обязательно коррелированных с же­лательностью, единственный метод состоит в применении шкал кор­рекции и корректирующих поправок, но и этот метод нельзя считать вполне надежным. Так что диагностика свойств, сопряженных с соци­альной желательностью, в ситуациях экспертизы всегда рискованна.

С другой стороны, в ситуации, когда сам испытуемый заинтере­сован в точных результатах («ситуация клиента»), психодиагност мо­жет пользоваться тестами-опросниками, не опасаясь артефакта соци­альной желательности.

Обычно в ходе практической проверки достоверности опросника психологу при обработке результатов пилотажного исследования при­ходится иметь дело с матрицей данных, подобной таблице, представ­ленной на рис.15.

Ключ по шкале лжи L изображен на рис. 15 в виде второго столб­ца — справа от столбца, содержащего ключ по основной диагности­ческой шкале С. Если в строке k+1 зафиксированы баллы, подсчитан­ные по основному ключу, то в строке k+2 - баллы, подсчитанные по ключу для шкалы лжи. Баллы Хk+2 отражают величину тенденции диссимуляции (социальной желательности) у данного испытуемого (низкие значения Хk+2 отражают тенденцию симуляции асоциальности или агравации - отягощения психической дезадаптации).

 

Рис. 15 Схематическое представление таблицы «пункты (t) - испытуемые (S)», вектора суммарных баллов Хk+1, вектора с баллами по шкале лжи Хk+2, вектора С со значениями ключа по основной шкале, вектора L с ключом по шкале лжи

 

Для успешного использо­вания шкалы лжи пункты, от­носящиеся к этой шкале (име­ющие ненулевые значения L), должны быть перемешаны в тестовом буклете с пунктами-вопросами, тестирующими основное психическое свой­ство (в противном случае -если все они собраны вмес­те - достоверность искусст­венно возрастает).

Оценка достоверности пунктов достигается с помо­щью статистической проце­дуры, аналогичной процеду­ре измерения внутренней валидности пунктов (надежно­сти-согласованности - см. раздел 3.2): если при измере­нии внутренней валидности следует прокоррелировать каждую строку 1, 2,..., k со строкой k+l, то при измерении достоверности следует прокоррелировать каждую строку 1, 2,..., k со строкой k+2 (подходят точечно-бисериальный или четырехклеточный коэффициенты корреляции). Наиболее высокие по модулю значе­ния корреляции должны быть получены в этом случае для пунктов, из которых составлена сама шкала лжи (это подтверждает ее консистентность, дифференцирующую силу для данной выборки). Положитель­ная значимая корреляция для г (ti., Хk+2) пункта из основной шкалы Сi О указывает на то, что данный пункт оказывается «прямым» по шкале социальной желательности; отрицательная значимая корреляция ука­зывает на то, что данный пункт является «обратным» по этой шкале.

При подготовке особенно значимого психодиагностического обсле­дования, в котором надо принципиально исключить всякую возмож­ность преднамеренной фальсификации результатов, следует дополнить критерий оценки достоверности с помощью особой шкалы лжи еще одним критерием, основанным на использовании «фальсифицирующей инструкции», Для этого после обычной инструкции той же самой пи­лотажной выборке психолог дает инструкцию: «А теперь снова выпол­ните задание, но старайтесь описать себя так, чтобы выглядеть макси­мально благоприятно в глазах большинства других людей». В резуль­тате применения такой инструкции психолог получает дополнитель­ную таблицу, аналогичную таблице на рис. 15, только содержащую фаль­сифицированные данные. В таком случае кроме подсчета очень грубого индекса «желательности» по формуле (3.3.2) у психолога возникает возможность поэлементного сравнения ответов испытуемых на один и тот же вопрос в обычной и фальсифицированной диагностических си­туациях. Очевидно, что недостоверным следует считать вопрос, отве­ты на который будут изменены в фальсифицированной ситуации в оп­ределенном систематическом направлении. Здесь пригодится простей­ший критерий значимости изменений, основанный на распределении «хи-квадрат» (Рунион Р., 1982, с. 57-61). Для каждого пункта строится четырехклеточная матрица сопряженности:

«После»

                                      +                          -

А=40

В=36

С=22

D=48

«До» +

 

 

Здесь в клеточке А указана частота сохранения ответа «верно» на некоторый /-и вопрос (из 76 ответивших «верно» таких оказалось толь­ко 40 испытуемых), в клеточке В - частота изменения ответа «верно» на ответ «неверно» и т. д. Как видим, смена инструкции привела к значительным изменениям. Но для оценки значимого направления этих изменений автор критерия Макнимар предложил сравнивать между собой по критерию «хи-квадрат» только элементы В и С этой матрицы:

 

                                       (3.3.3)

 

где  - вычисленное эмпирическое значение статистики хи-квадрат

с одной степенью свободы. Для нашего примера =2,91, что ниже, чем граничное значение  =3,84, и, следовательно, нулевая гипоте­за об отсутствии значимых направленных изменений не может быть отвергнута - пункт не является значимо нагруженным артефактным фактором социальной желательности и может быть включен в диаг­ностический вариант теста-опросника без изменений.

По результатам такого исследования удобно составить табличку К2: в первом столбце -показатели корреляции пунктов со шкалой лжи, во втором - показатели значимости изменений при переходе к фальсификации. Безусловно достоверными можно считать только те пункты, которые не получили значимых :коэффициентов ни в первом, ни во втором столбце. Если таких пунктов оказывается слишком мало для составления надежной шкалы и если среди недостоверных пунктов достаточно много таких, которые обладают существенной внут­ренней (корреляция с суммарным баллом по основной шкале) или внешней (корреляция с критерием) валидностью, то следует прибегнуть к тактике балансирования: ввести в основную шкалу одинако­вое количество «прямых» и «обратных» пунктов по шкале социаль­ной желательности так, чтобы все четыре квадранта на рис. 13 были заполнены пунктами равномерно (среди «прямых» по основной шка­ле было бы поровну «прямых» и «обратных» по желательности, и среди «обратных» по основной - также поровну).

Без указанных предосторожностей тест-опросник неизбежно бу­дет давать систематическое искажение результатов (в сторону по­вышения или понижения баллов по основной шкале) всякий раз, ког­да испытуемый будет квалифицировать диагностическую ситуацию как ситуацию экспертизы.

Указанные проблемы и приемы обеспечения достоверности от­носятся не только к тест-опросникам, но и к другим техникам стан­дартизованного самоотчета, подверженным мотивационным искаже­ниям. Существует теоретическая возможность преодолеть все эти проблемы. Но на практике это оборачивается огромной эмпирико-методической работой.

Другой путь - управление процессами категоризации в ходе са­мой диагностики. В так называемой «репертуарной модификации» тест-опросника испытуемому специально предлагают выполнять тест не только от своего имени, но и от имени определенного репертуара ролей: «большинство людей», «моральный человек», «преуспевающий человек» и т. п. (Шмелев А. Г. и др., 1984). Извлечение практических выгод из подобной модификации обусловлено возможностью компь­ютерной обработки результатов либо сразу же после тестирования, либо даже в ходе самого тестирования (см. раздел 3.6).

Порядок действий психолога при проверке валидности. Очень трудно выделить универсальный алгоритм работы психолога по про­верке валидности, ибо существуют различные подходы к обеспече­нию валидности, обусловленные теоретико-методологическими раз­личиями определенных психологических школ. Для прагматически ориентированных тестологов (каковыми традиционно являлись до не­давнего времени почти все англо-американские специалисты) глав­ный момент - поиск операционально строго заданного социально-прагматического критерия валидности, по отношению к которому ди­агностические тесты и их составные части (пункты) подбираются как бы автоматически -в ходе эмпирико-статистических процедур сбора и корреляционного анализа результатов. Но, конечно, неверно было бы приписывать этому подходу «бездумность в опоре на статистику»: ведь статистика только тогда позволяет выявить валидное подмноже­ство пунктов, когда исходное множество подобрано не случайно - с использованием априорных корректных содержательно-психологичес­ких представлений.

Современные методологи психологического тестирования факти­чески единодушно приходят к признанию (как наиболее оптималь­ной) рационально-эмпирической стратегии конструирования теста и проверки валидности. Перечислим этапы этой стратегии.

1. Теоретический анализ диагностического конструкта, разработка теоретической концепции тестируемого психического свойства. Вы­явление (с использованием литературы) системы взаимосвязанных ди­агностических конструктов, внутри которой новый диагностический конструкт характеризуется определенными структурно-функциональ­ными связями и отношениями. Прогнозирование результатов корре­ляционных экспериментов по проверке конструктной валидности.

2.  Выделение составных частей теоретического конструкта, фор­мулирование системы «эмпирических индикаторов» - операциональ­но однозначных показателей, фиксирующих проявление конструкта в различных поведенческих ситуациях. Конструирование пунктов теста.

3.  Формулирование релевантного социально-прагматического критерия для проверки валидности.

4.  Планирование и проведение корреляционного исследования (или квазиэксперимента) на специально подобранной выборке испы­туемых, для которых известно значение критериального показателя, а также результаты по родственным психологическим тестам. При необходимости на этих испытуемых проводятся дополнительные те­сты с целью получить возможность корреляционной проверки конст­руктной валидности теста (экспертные оценки в данном случае рас­сматриваются в статусе одной из возможных параллельных процедур получения критериальной или психологической информации). Оцен­ка валидности эмпирических индикаторов.

5.  Исследование достоверности результатов (если используется самоотчет и диагностическая ситуация может быть воспринята ис­пытуемыми с настороженностью). Оценка достоверности эмпиричес­ких индикаторов.

6. Отсев пунктов, не удовлетворяющих критериям валидности и достоверности. Измерение надежности для сокращенной шкалы, со­стоящей только из валидных пунктов. Если надежность оказывает­ся невысокой, то психолог снова возвращается к этапу 1 - уточняет теоретические представления.

 

3.4. ТЕХНОЛОГИЯ СОЗДАНИЯ И АДАПТАЦИИ МЕТОДИК

 

Рассматривая в предыдущем разделе вопрос о порядке проверки валидности, мы вплотную подошли к вопросу о целостной стратегии создания, эмпирической апробации и внедрения методики в практику.

Создание оригинальной методики или адаптация зарубежной ме­тодики не могут сводиться только к проверке (или перепроверке) от­дельных психометрических свойств - репрезентативности, надежно­сти, валидности, достоверности - в произвольной последовательнос­ти. В одних случаях целесообразно начинать с одного этапа работы, в других - с другого.

В действительности любая реальная ситуация использования те­ста не является ситуацией только «конструирования» или только «применения». Можно без преувеличения сказать, что существует конти­нуум между крайними полюсами:

 

«конструирование» __________________ «применение»

 

и каждая ситуация до определенной ступени удалена от обоих полю­сов. Трудно назвать такой случай, когда бы конструирование совер­шенно нового теста начиналось с нуля, «на пустом месте». Также труд­но найти и такие случаи, когда все аспекты тестирования были бы полностью неизменными и воспроизводили бы уже совершенно ис­следованную нормативную ситуацию применения готового теста.

Но все это многообразие ситуаций, всю комбинаторику независи­мых параметров психологи-практики, как правило, пытаются свести к двум-трем типовым ситуациям.

1.  Ситуация применения. Тест кем-то разработан (возможно, В: других социокультурных условиях), известны тестовые нормы, полу­ченные на представителях данной языковой культуры (несоответствие выборки стандартизации и выборки применения по половозрастной структуре и профессионально-культурным признакам признается не­существенным).

2. Ситуация адаптации. Тест кем-то разработан – проверены  на­дежность и валидность, но отсутствуют тестовые нормы (как правило, отсутствуют вообще для любых представителей данной языковой культуры). Задача адаптации сводится, таким образом, к построению тестовых норм.                      

3. Ситуация конструирования. Есть концепция психического свой­ства, но нет процедуры его измерения, удовлетворяющей требованиям места, времени, возможностям количественного анализа и ограничениям прочих ресурсов. Надо придумать измерительную процедуру, проверить ее надежности валидность, построить тестовые нормы.

Остановимся прежде всего на вопросах адаптации так называе­мых переводных тестов. Путь быстрого пополнения репертуара ме­тодик за счет множества готовых зарубежных методик кажется мно­гим психологам наиболее экономичным, кратчайшим путем к надеж­ной и валидной психодиагностике. Но ведь если при этом адаптация сводится только к построению нормативного распределения тесто­вых баллов, то это означает, что валидность и надежность адаптированной методики в новых условиях принимаются на веру, а теорети­ческая концепция автора теста и содержание использованных им критериев валидности просто переносятся в наши условия без измене­ний (ведь для любой, в том числе и для невалидной и ненадежной методики, можно получить распределение).

Подобный перенос дает пренебрежимые погрешности только для тестирования относительно элементарных психических свойств (та­ких, как свойства нервной системы, функциональные состояния, сенсомоторные параметры, элементарные когнитивные функции, при­чем с использованием объективных процедур (психофизиологичес­кая регистрация, тесты с «физическими» критериями успеха и т. п.). При тестировании интегральных психических свойств личности и индивидуального сознания (черты, мотивы, установки, самооценка, общие способности, стиль общения, ценностные ориентации, инте­ресы и т. п.), а также при употреблении любых лингвистических средств в самой процедуре тестирования (включая не только форму­лировки задач, вопросов; но и исходную формулировку инструкции к тесту) и использовании культурно-специфических критериев оценки правильности .результата (определения шкального ключа) ограничи­ваться только сбором тестовых норм при адаптации - недопустимо!

Требуется серьезная эмпирическая работа по проверке надежно­сти и валидности в новых социокультурных условиях, работа, факти­чески соответствующая по своему объему созданию оригинальной методики. С этой точки зрения, заимствование зарубежных общедиаг­ностических тестов способностей, черт характера, интересов и т. п. вовсе не оказывается кратчайшим путем к психодиагностике. Этот путь кажется короче только тем, кто сознательно или по неведению  пренебрегает принципами психометрики.

Перечислим необходимые этапы эмпирико-статиетической рабо­ты при адаптации многомерного переводного тест-опросника.

1. Анализ внутренней валидности, внутренней согласованности пунктов, из которых состоит тест-опросник. Этот анализ совершенно необходим, если в зарубежной методике он применялся в качестве средства самого конструирования методики. Этот-анализ призван по­казать, что существует некое (еще неясно, какое именно) общее диаг­ностическое свойство, лежащее на пересечении всех эмпирических индикаторов (в центре «пучка» скоррелированных пунктов-векторов). Такой анализ обязателен по отношению ко всем тестовым шкалам, полученным с помощью факторного анализа, например к тест-опросникам EPI Айзенка и 16PF Кеттелла. А вот к опроснику «локус конт­роля» или ко многим основным клиническим шкалам MMPI требова­ние внутренней согласованности применять не обязательно, так как пункты в эти шкалы подбирались по внешнему критерию и не связа­ны в один «пучок». Анализ внутренней согласованности может быть применен и к одномерным, и к многомерным тестам. В первом слу­чае достаточно иметь настольный калькулятор. Для многомерных те­стов необходимо использование специальной компьютерной програм­мы «Анализ пунктов».

По отношению к негомогенным шкалам анализ внутренней со­гласованности позволяет осуществить в снятом виде необходимую проверку информативности пунктов (процент правильных или под­тверждающих ответов должен соответствовать оригинальной автор­ской версии).

2. Проверка устойчивости к перетестированию. Эта проверка со­вершенно необходима при диагностике свойств, по отношению к ко­торым теоретически ожидается инвариантность во времени. Анализ ретестовой надежности может быть (так же как анализ надежности -согласованности) совмещен с исследованием информативности от­дельных пунктов теста, а также, возможно, и устойчивости отдель­ных пунктов. Без сведений о ретестовой надежности психолог не имеет права использовать тест для построения любого элементарного ста­тического экстраполирующего прогноза (см. раздел 3.5).

3. Анализ корреляций с релевантным внешним критерием. Этот этап адаптации совершенно необходим, если тест разрабатывался из­начально как критериально-ориентированный, т. е. отбор пунктов производился на основании их корреляций с каким-то критерием валидности. Например, подобная работа проделана коллективом Ф. Б. Березина для сокращенной модифицированной версии MMPI (Березин Ф. Б. и др., 1976).

4. Проверка или ре стандартизация тестовых норм. Об этом этапе уже говорилось выше. К сожалению, только этот этап работы по адап­тации тестов до недавнего ывремени признавался всеми психолога­ми как необходимый. Но и в этом случае далеко не всегда воспроиз­водилась необходимая статистическая работа по проверке устойчи­вости полученного распределения тестовых баллов к расщеплению выборки (см. раздел 3.1).

5. Специфичный этап для многомерных тестов - проверка вос­производимости структуры отношений между шкалами. Например, для теста Айзенка принципиальна ортогональность, статистическая независимость факторов «экстраверсия - интроверсия» и «нейротизм - стабильность». На воспроизводимости структуры связей шкал между факторами 16PF основывается корректность подсчета вторич­ных факторов (Ямпольский Л. Г., 1981; Мельников В. М., Ямпольский Л. Г., 1985).

Даже беглый взгляд на пять перечисленных этапов позволяет убе­диться в том, что адаптация зарубежных тестов мало чем уступает по объему эмпирико-статистической работы созданию оригинальных ме­тодик. Здесь было бы даже более адекватным использование не тер­мина «адаптация», а выражения «исследование зарубежной методики на отечественной выборке».

Тем не менее не следует понимать сказанное как призыв к пол­ному отказу от работы с зарубежными методиками. Нет, конечно же, такая работа должна проводится интенсивно и планомерно. Особен­но по отношению к тем методикам, которые уже получили между­народное распространение, доказали свою кросскультурную универ­сальность, адаптированы и успешно применяются во многих стра­нах. Создание отечественных эквивалентов международных тестов позволяет использовать международный опыт валидизации, теоре­тического осмысления и практического использования этих тестов. Сравнение результатов, структурно-функциональных характеристик адаптированных зарубежных и отечественных тестов позволит рос­сийским психологам глубже понять, установить на конкретно-эмпи­рическом уровне специфику влияния образа жизни на психологи­ческий склад личности россиян, раскрыть разнообразие историчес­ких и актуальных детерминант, обусловливающих социально полез­ные и социально вредные тенденции в психологической диф­ференциации индивидов в современных условиях, что совершенно необходимо для научного управления процессами воспитания и фор­мирования человека.

Особые задачи ставит перед психологом ситуация «внутрикуль-турного переноса» теста на новую популяцию, отличающуюся от вы­борки стандартизации половозрастными или профессионально-куль­турными особенностями. В этом случае необходимо:

1. Проверить валидность методики в тмо случае, если методи­ка чувствительна по своему содержанию к профессиональной или региональной специфике (могут ли отвечать пенсионеры, или школьники, или жители отдаленных регионов на вопросы, подра­зумевающие типичные ситуации из жизни студента, обучающего­ся в крупном городе европейской части России?). Для этого надо выбрать по возможности максимально экономичную процедуру проверки валидности. Размеры выборки в эксперименте по про­верке валидности должны быть такими, чтобы можно было наде­яться на получение статистических значимых связей между тестовым показателем и критерием валидности (это, как правило, не менее 30 испытуемых).

Если результаты проверки валидности оказываются неудовлетво­рительными (коэффициент корреляции явно ниже 0,5, и дальнейшее наращивание выборки все равно не оправдает применение .теста со столь низким показателем валидности), то по собранным результатам следует произвести простейший анализ пунктов: посмотреть, не ока­зались ли некоторые пункты явно неинформативными (все испытуе­мые отвечают одинаково), не оказались ли некоторые вопросы явно бессмысленными или слишком «прямыми», социально значимыми в данной ситуации. Не исключено, что при исключении неудачных пун­ктов из подсчета тестового балла (после приравнивания С=0).,искомая валидность будет обнаружена.            

В отсутствие доступного внешнего критерия необходимо прибегнуть к проверке внутренней валидности, консистентности методики.

2. Проверить соответствия тестовых норм. Только после получения позитивного результата при проверке валидности целесооб­разно расширять выборку и реконструировать эмпирическое распределение тестовых баллов (см. раздел 3.1). Квантили этого распреде­ления необходимо сравнить с квантилями нормативного распреде­ления; если расхождения оказываются пренебрежимыми (не превышают ошибку измерения), то, можно принять вывод о приложимости к данной популяции универсальных тестовых норм. Но на к практике чаще возникают значимые отличия (оценка близости двух распределений производится по формуле (3.1.15) на с. 9.6). В этом случае психолог должен построить так называемые частные тесто­вые нормы, причем не только для использования в собственной диагностической практике, но и для пополнения информационно-ме­тодического банка данных отечественной психодиагностики (копию таблицы распределения тестовых баллов психолог должен послать в тот диагностический методический центр, с которым он поддер­живает методические связи - получает методические материалы, проходит переподготовку и т. п.).

Подчеркнем, что абсолютное большинство ситуаций, которые обычно расцениваются как ситуации «применения», на самом деле являются ситуациями более или менее серьезного «внутрикультурного переноса». Именно эти обстоятельства предопределяют высокий уровень требований к психометрической подготовке психологов-психодиагностов (см. раздел 3.6).

При создании методики, как это уже было сказано в предыдущем разделе, решающее значение имеют методологическая ориентация и статус психолога.

Под статусом в данном случае понимаются существенные раз­личия в нормативных (закрепленных в должностных инструкциях) требованиях к продукту деятельности психолога, работающего в ис­следовательском учреждении, и психолога, работающего в практи­ческом учреждении. Если в первом случае психолог имеет право считать своим «конечным продуктом» внутрипсихологическую валидизацию сконструированной методики, то во втором случае он, как правило, обязан обеспечить практическую эффективность сво­ей психодиагностической программы - указать на статистически значимую связь результатов диагностики с величиной какого-то со­циально ценного показателя - критерия, а затем построить на осно­ве этой связи психологическую концепцию «вмешательства» (адми­нистративного или психологического воздействия на ситуацию с целью ее изменения в желаемом направлении – в сторону максими­зации данного показателя).

Указанные изначальные различия в статусах психолога-иссле­дователя и психолога-практика предопределяют оправданные раз­личия в стратегии конструирования тестов и тестовых батарей. Для психолога-исследователя главная ценность - это теоретическая обо­снованность и эмпирическая однозначность диагностического кон­структа, которой он достигает с помощью оправданной ориентации на конструктную валидизацию. У исследователя хватает ресурсов для того, чтобы обеспечить множественность разнообразных по сво­ему статусу критериев валидности - от субъективных оценок валидности включенных наблюдателей (L-данные по Кеттеллу) до экспе­риментального моделирования реальных ситуаций проявления из­меряемого свойства (Г-данные по Кеттеллу, см. также: Мельников В. М., Ямпольский Л. Г., 1985). Для психолога-практика главная ценность - это эффективность, пусть даже она будет достигнута с помощью теоретически эклектичного инструмента - эмпирическо­го средства, не имеющего соответствующего научно строгого кон­структа.

Появление и размножение прагматических тестов, очевидно, обус­ловлено действием объективного социально-исторического механиз­ма, который можно было бы кратко назвать «опережающим запросом практики». Этого феномена не было бы, если бы все запросы практи­ки можно было заранее предвидеть и рационально спланировать, под­готавливая релевантные научно обоснованные диагностические про­цедуры. Но такое предвидение всегда удается осуществить лишь в определенной мере - реальная практика тем и отличается от дедук­тивного движения в плоскости абстракций, что всегда приводит к стол­кновению с новыми и неожиданными явлениями, что обусловливает и появление неожиданных запросов.

Большинство ценных прагматических тестов с исторической не­избежностью становятся предметом для изучения со стороны психо­логов-исследователей, апостериорно реконструирующих научную концепцию валидности этих тестов, что значительно улучшает их ха­рактеристики и адекватизирует сферу применения.

Психодиагностика как специфический институт, реализованный в форме управляющего кольца «наука - практика - наука - практи­ка...», достигнет оптимальных режимов в своем функционировании, если любые попытки конструирования и применения любых тестов будут тщательно документироваться, будут доступны для повторения в любом звене (исследовательском или практическом) психологичес­кой службы. При обеспечении эффективной информационной базы, оперативных форм информационной связи между звеньями этой сис­темы (как методологическими, так и практическими) всякое практи­ческое применение тестов станет одновременно и работой по созда­нию новых методик.

 

3.5. ПРОГНОЗИРОВАНИЕ И РАСПОЗНАВАНИЕ ОБРАЗОВ

 

Кардинальное значение для психодиагностики имеет проблема прогнозирования. Существует точка зрения, разделяющая психоди­агностику и так называемую психопрогностику (Забродин Ю. М., 1984). Это указывает на самостоятельное значение проблемы прогно­зирования.

В действительности, любая психодиагностика служит прогнози­рованию - на больших или меньших отрезках времени. То, что назы­вается диагностикой текущего состояния объекта, имеет следующий смысл. В технике сконструированный агрегат подвергают стендовым испытаниям. Полученные результаты приписывают текущему состо­янию объекта, имея в виду, что выключенный агрегат до его эксплуа­тации в реальных условиях уже не будет изменяться сколь-нибудь су­щественным образом. При этом подразумевается, что именно при работе включенного агрегата может измениться его состояние, в ча­стности, выход из допустимого режима.

В психологии дело, конечно же, обстоит по-другому. И перенос подразумеваемых, имплицитных представлений из технической ди­агностики в психодиагностику неправомерен, как, впрочем, непра­вомерен такой перенос уже и по отношению к медико-биологичес­кой диагностике человеческого организма. Организм человека, его психика - это не агрегат, который произвольно можно выключить на период от тестирования до реального испытания. Все это время человек продолжает жить, активно взаимодействовать со средой. Даже в изоляции, даже во сне мозг человека проделывает большую работу, переводя полученную информацию из одних отделов памя­ти в другие (Касаткин В. Н., 1967). Все это означает, что принцип статистической экстраполяции результатов психодиагностического измерения нельзя считать оправданным без проведения специаль­ных проверок.

Когда психолог по результатам тестирования регистрирует у не­которого индивида А показатель Ха, а у некоторого индивида В пока­затель Хb, так что Хa> Хb, то из этого вовсе не следует автоматичес­ки, что соотношение Хa> Хb сохранится в течение следующей недели, месяца, года. Для принятия стратегии экстраполяционного статистического прогноза требуется предварительно произвести эмпиричес­кое измерение надежности - устойчивости (ретестовой надежности) на заданном промежутке времени.

При этом важна не только длина отрезка времени между двумя изме­рениями, но и его заполненность теми или иными значимыми для инди­вида событиями. Приведем простой пример. Организовано психологи­ческое обследование абитуриентов вуза. Психологи пытаются измерить уровень интереса поступающих к избранной специальности Однако они применяют «лобовые» методики опроса, не защищенные от преднаме­ренной фальсификации (абитуриенты сознательно, или даже бессозна­тельно, будут искажать результаты в сторону повышенного интереса - чтобы произвести благоприятное впечатление). Фальсификация здесь - только один из возможных источников некорректности статистического прогноза. Для эмпирического измерения силы этого артефакта не обяза­тельно проводить повторное измерение через несколько лет. Имеет смысл провести повторное обследование по той же методике всех студентов, сразу же после их зачисления на первый курс. Если возникнет слишком много перестановок типа Ха < Хb, то ранговая корреляция «тест -ретест» окажется слишком слабой, и это доказывает неправомерность использо­вания «лобовой» методики для статического прогноза. Другой возмож­ный источник нестабильности ранговой шкалы (порядковой шкалы тес­та) обусловлен в данном примере зависимостью уровня интереса к пред­метной области от уровня знаний о предмете. В ходе обучения в вузе студенты приобретают более детальные знания о предмете, о своей ус­пешности в освоении специальности, и от этого уровень интереса может существенно изменяться. Конечно, этот фактор - в отличие от фактора фальсификации - действует на более длительных промежутках време­ни. И здесь опять же требуются специальные измерения ретестовой ус­тойчивости для применения статического прогноза.

Приведенный выше пример показывает, что в некоторых случаях целесообразно начинать решать проблемы психопрогностики без вся­кого привлечения внешней по отношению к тесту критериальной ин­формации, т. е. средствами проверки надежности, но не средствами проверки валидности. Если уже таким способом будет получен отри­цательный результат, то заведомо будет получен и для измерения ва­лидности статического прогноза (вспомним основной принцип: валидность методики не превышает ее надежность).

Однако надежность лишь необходимое, но, естественно, недоста­точное условие прогностической валидности. Можно убедиться в высо­кой устойчивости тестового показателя на длительных промежутках вре­мени, но из этого вовсе не следует, что будут получены значимые линей­ные корреляции этого показателя с требуемым критерием валидности -эффективности.- корреляции, оправдывающие статический прогноз.

Как правило, на основе диагностики принимаются решения, кото­рые соотносятся между собой как события на шкале наименований или на шкале порядка. Каким образом учитываются сегодня при приеме в вуз показатели школьной успеваемости абитуриентов? Существуют три варианта, три градации, соотносимые друг с другом по шкале порядка: выпускникам школы - медалистам предоставляются льготные условия (при успехе на первом экзамене от остальных вступительных экзаме­нов медалист освобождается), лица с удовлетворительным средним баллом допускаются к конкурсным вступительным экзаменам и сдают все экзамены; наконец, лица с неудовлетворительным средним баллом могут вообще не допускаться к вступительным экзаменам. На этом при­мере видно, что средний балл аттестата используется как некоторый показатель «теста», в соответствии с которым абитуриентов разделяют на три категории, по отношению к которым неявно применяется «по­рядковый» прогноз: предполагается, что медалисты будут успешнее обычных выпускников школ, а обычные выпускники - успешнее тех, кто учился в школе очень слабо.

«Порядковый» прогноз сохраняет свою эффективность не только в статических условиях, но и в условиях таких динамических измене­ний объектов прогнозирования, при которых порядковая структура оказывается неизменной. Предположим, что в: ходе обучения в вузе все студенты по мере более глубокого ознакомления с предметом ис­пытывают нарастающий интерес к своей специальности, но если по­рядковая структура сохраняется (Ха продолжает превышать Xb, несмот­ря на то что Xb приближается к Ха), то «порядковый» прогноз все рав­но остается корректным.

Линейные и порядковые прогностические стратегии на практике применяются не к одномерным, а к многомерным данным. Среди математических моделей прогнозирования до сих пор наибольшей популярностью пользуются относительно простые (а иногда и нео­правданно упрощенные) регрессионные модели.

При этом для многомерного случая задача психометриста сводится к построению уравнения множественной регрессии:

 

Y= ß1X1+ ß2X2…..+ ßiXi+ ßkXk                              (3.5.1)

 

где Y- прогнозируемая переменная (критерий прогностической ва-лидности);

Xi - значение i-го тестового показателя из рассматриваемой бата­реи тестовых показателей;

ßi, - значение весового коэффициента, указывающего, на сколько (в единицах стандартных отклонений) изменяется прогнозируемая переменная при изменении тестового показателя Xi.

Для составления указанного уравнения требуется произвести «уп­реждающее» измерение тестовых показателей по отношению к критериальному показателю Y, измерение которого производится по ис­течении некоторого отрезка времени  T, называемого в прогнозиро­вании периодом упреждения.

Общая эффективность прогноза на основе регрессионного урав­нения оценивается с помощью подсчета коэффициента множествен­ной корреляции R2 (Суходольский Г. В., 1972) и последующей оценки его значимости по критерию Фишера:

 

                                       (3.5.2)

 

где  - эмпирическое значение статистики Фишера со степенями сво­боды V1 = k и У2 = N-k;

Nколичество индивидов;

k - количество тестовых показателей.

Не следует забывать, что основой применения этой модели про­гноза является экстраполяция - предположение о том, что на новом отрезке времени T’ будут действовать те же тенденции связи пере­менных, что и на отрезке T, на котором прежде измерялись весовые коэффициенты ßi. Не следует также забывать, что корректность про­гноза обусловлена периодом упреждения: для больших (или меньших) T использование уравнения (3.5.1) может оказаться некорректным.

Прогностические возможности указанного метода ограничены однократностью измерения тестовых показателей .X1, Х2 ..., Xk. В силу однократности измерения этот метод оказывается эффективным опять-таки только по отношению к самым универсальным и статическим показателям (таким, например, как интегральные свойства темпера­мента или нервной системы), обеспечивающим очень грубый, веро­ятностный, приближенный прогноз.

В некоторых случаях эффективность этого метода может суще­ственно повыситься, если использовать хотя бы двукратное (с неболь­шим интервалом в две-три недели) измерение системы показателей Х1 Х2,..., Xk. Уже таким способом можно, например, учесть вклад фак­тора «усвоение знаний» в прогнозирование мотивационной вовлечен­ности (уровня интереса) студента в свою специальность. Повторное измерение (например, через месяц после начала обучения в вузе) по­зволяет выявить, в каком направлении действует фактор «усвоение знаний» в своем влиянии на уровень интереса данного студента: мо­жет оказаться, что в результате разнонаправленного действия этого фактора немало пар студентов уже через месяц поменяются местами в ранговом ряду по уровню интереса (Ха< Хb). В этом случае в урав­нение (3.5.1) целесообразно ввести не статический показатель Xi a простейший динамический показатель Хi, = . Кроме того, не исключена возможность одновременного использования в уравнении (3.5.1) и статических Xi. и динамических  Хi. показателей; тогда разра­ботанная модель прогноза будет учитывать как достигнутый уровень (экстраполировать статику), так и намечающиеся тенденции (экстра­полировать тенденции).

Приведем еще один содержательный пример. Многочисленные эмпирические исследования по прогнозированию супружеской со­вместимости (Обозов Н. Н., 1979) показали неудовлетворительно низкий уровень надежности прогноза на основе таких показателей, как однократно измеренный уровень сходства (темперамента, моти­вов, интересов, ценностных ориентации) или взаимодополнитель­ности психических свойств будущих супругов. Но эту надежность можно существенно повысить, если ввести в уравнение (3.5.1) по­казатели типа  Х.. В данном случае содержательно-психологичес­кий смысл этих показателей будет заключаться в следующем: они указывают на то, в каком направлении действует на уровень сход­ства (совместимости) опыт взаимодействия будущих супругов. По­тенциально несовместимые супруги в ходе взаимодействия (за период помолвки), как правило, дивергируют в своих показателях (на­пример, имеющиеся незначительные акцентуации характера взаим­но усиливаются). И наоборот, потенциально совместимые супруги могут очень быстро конвергировать: оказывается достаточным про­ведение одного-двух обсуждений с участием психолога по спорным вопросам, чтобы сблизиться в представлениях о желаемом семей­ном укладе и образе жизни.

Более сложные математические методы прогнозирования (напри­мер, учитывающие циклическую динамику объектов) пока еще редко используются в психодиагностике, так как требуют частых многократ­ных измерений системы тестовых показателей, что оказывается не­возможным по чисто практическим причинам. Тем не менее уже се­годня можно твердо констатировать недостаточность линейных мо­делей прогнозирования. Для ознакомления с рядом других подходов к прогнозированию мы рекомендуем психологам обратиться к руко­водству «Рабочая книга по прогнозированию» (М., 1982).

Остановимся теперь более подробно на подходе, который ныне представляет собой реальную альтернативу ограниченным линей­ным статистическим моделям и позволяет строить эффективный прогноз для более сложных зависимостей между прогнозируемыми (зависимыми) и прогнозирующими (независимыми) переменными. Этот подход, по традиции, принято называть распознаванием обра­зов, так как разработка его математического аппарата была во мно­гом стимулирована инженерными задачами конструирования искус­ственных систем зрения, слуха, других органов чувств (Распознава­ние образов. М., 1970).

В психодиагностике роль «элементарных сенсорных данных» выполняют первичные тестовые показатели X1 Х2,..., Xk, а роль «об­раза» (выходного сигнала системы) - соответствующая диагностичес­кая категория. Таким образом, по существу, распознавание образов[19] и есть диагностика в широком смысле.

Поясним специфику подхода на простейшем схематическом при­мере. Пусть Ру -вероятность такого типового критерия оценки студен­тов, как успеваемость, Х1 - уровень интереса к специальности, выяв­ленный у абитуриента, Х2 - уровень его знаний о специальности.

На рис. 16 точки X1 = 0 и Х2 = 0 - медианные значения соответ­ствующих тестовых показателей. В данном упрощенном примере в статусе «образа» выступает каждый из четырех квадрантов диагнос­тического пространства. Для предсказания Ру мы не можем постро­ить линейной комбинации Х1 и Х2, какие бы коэффициенты ß1, и ß2 мы ни взяли. Для предсказания Рy мы должны зафиксировать попадание индивида в заданную область пространства параметров. «Образ», или диагностическая категория, и есть на геометрическом языке опреде­ленная область в пространстве параметров.

 

 

Рис. 16. Зависимость вероятности критериального события р и диагностических параметров X1 и Х2

 

С точки зрения распознавания образов, предварительная задача диагностики (предваряющая практические задачи) – определить границы диагностических категорий - областей в пространстве парамет­ров, которым эмпирически корректно могут быть приписаны некоторые пороговые (качественно специфичные) значения прогнозируемого критериального показателя. Это задача построения «разделяющего правила» (или «решающего правила»). Точность такого разделения и предопределяет прогностическую валидность методики на данной совокупности испытуемых в данной диагностической ситуации.

Репрезентативность выборки при этом определяется степенью изменения точности разделения при увеличении совокупности обсле­дованных. Влияние того или иного параметра на точность разделе­ния определяет «вес», с которым входит данный параметр в задачу диагностики.

Построение формальной процедуры разделения может произво­диться по-разному. В простейшем случае - это сравнение тестового показателя с некоторым порогом. В более сложных случаях применя­ются методы дискриминантного анализа, позволяющие описывать «разделяющие правила» (границы диагностических областей в про­странстве параметров) в виде сложных функций сразу от нескольких параметров.

Применение определенного метода для решения задачи построе­ния системы диагностических категорий определяется несколькими факторами: во-первых, это соответствие допущений, положенных в основу алгоритма, содержательным представлениям о психологичес­кой типологии индивидов в рамках рассматриваемой системы психо­диагностических параметров; во-вторых, это степень полноты имею­щейся информации для эффективной «остановки» алгоритма, обес­печивающей оптимальное решение задачи за приемлемое время.

Под полнотой информации здесь, имеется в виду наличие доста­точно многочисленных групп индивидов, четко и однозначно класси­фицированных по заданной системе критериев. В этом случае пост­роение решающего правила сводится к применению какого-либо ал­горитма автоматической классификации, приспособленного к работе с заданными классами. Если же критериальные классы представлены неполно - всего несколькими представителями, для которых при этом не всегда известны все значения необходимых параметров, - то воз­никает ситуация, требующая применения так называемых эвристи­ческих алгоритмов (более подробно о применяемых алгоритмах клас­сификации см. кн.: Типология и классификация в социологических исследованиях. М., 1982).

Остановимся на одном из методов распознавания, получившем применение в психодиагностике, — на семействе алгоритмов вычис­ления оценок (АВО), предложенном Ю. И. Журавлевым и его учени­ками (1978).

Основную задачу распознавания образов можно сформулировать как задачу отнесения объекта 5 к одному или нескольким классам К1 К2,..., Кi на основе информации о классах I (K1), (К2),..., Ii), ин­формации об объекте I(S) и предположения о близости объекта к клас­су. Другими словами, задачу распознавания можно сформулировать как задачу определения того, обладает ли объект определенными свой­ствами.

В основе АВО лежит принцип частичной прецедентности: бли­зость объекта к классу тем больше, чем больше частей в его описании «похожи» на соответствующие части в описаниях' объектов, чья принадлежность классу известна. Например, в одном из вариантов АВО (Зеличенко А. И., 1982) функция близости объекта S к классу К опре­деляется так:

 

                                  (3.5.3)

 

где  - i-й объект, принадлежность которого к классу К уже известна;

ai (S) - i-й элемент (параметр) в описании объекта;

P1 - его вес;

εj  - i-й порог.

После того как вычислены Г(S1 K1,), ... , Г(S1 K1,) на основании некоторого решающего правила (зависящего от вектора параметров , принимается решение о принадлежности объекта к одному или нескольким классам К1, ..., К1 В задачах психодиагностики S- это испытуемый.

Таким образом, каждый вариант АВО определяется набором зна­чений параметров. В нашем случае- это векторы . Если информация об объекте S представлена в виде I(S) = (а1,..., а2), то элемент вектора опорных множеств ωj(S) = аi, a εj -j-й порог.

В качестве примера решающего правила можно привести следу­ющее (линейное пороговое решающее правило):

объект S принадлежит к классу Kt если

 

                                 (3.5.4)

 

объект S не принадлежит к классу Kt если

                                            (3.5.5)

 

в остальных случаях -отказ от распознавания принадлежности объек­та S к классу Kt.

В работе алгоритмов распознавания вообще и АВО в частности мож­но выделить два этапа: обучение и собственно распознавание. На этапе обучения, как уже говорилось, происходит настройка алгоритма, т. е. выбор таких его параметров, которые обеспечивают оптимальное в нег котором смысле распознавание объектов обучающей выборки (объек­тов, принадлежность которых к классам К1, ... ,Ki, известна). На этапе собственно распознавания происходит отнесение к классам K1,..., Кi, тех объектов, принадлежность которых к классам априорно неизвестна.

Точность распознавания на этапе обучения измеряется полнотой и адекватностью распознавания эталонных объектов. Наряду с понятием «точность» (абсолютная отделимость) иногда удобно использовать по­нятие относительной отделимости объектов обучающей выборки, при­надлежащих к различным классам. В случае, когда распознавание ведется для двух классов (например, в профориентации - для дифференци­ального прогноза успешности оптанта в одной из двух профессиональ­ных областей), относительную отделимость можно определить как

 

                                                  (3.5.6)

 

где X - точность при обучении (выраженная в процентах), a  -минимальная возможная точность обучения (совпадает с долей объек­тов в наибольшем классе от общего объема обучающей выборки). На этапе собственно распознавания точность характеризует главным об­разом репрезентативность обучающей выборки (выборки валидизации). Чем выше репрезентативность, тем больше совпадают показа­теле точности на этапах обучения и собственно распознавания.

Использование АВО кроме решения задачи распознавания позволяет получить следующую информацию:

1. Информационные веса отдельных элементов (параметров) опи­сания объектов. Эти веса измеряются через изменение точности рас­познавания при исключении соответствующих параметров из описа­ния эталонных объектов:

 

                                  (3.5.7)

 

где X - точность распознавания при Рj = 1; X() - точность распозна­вания при Р. = 0, а а - нормирующий множитель. Информационные веса интерпретируются как мера прогностической важности параметров.

2. Оптимальные значения порогов  , т. е. значения  , обеспечи­вающие наивысшую точность распознавания. Эти значения порогов в нашем случае можно .интерпретировать как чувствительность мето­дики; εj - своего рода дифференциальный порог на шкале тестового показателя aj определяющий переход индивида из одной диагности­ческой категории в другую. Пусть на этапе разработки теста (тесто­вой батареи) была обследована группа из К человек, про которых из­вестно, что k1 из них относится к одному классу, а К2 - к другому, К = К1 + К2. Выбрав случайным образом из этой группы М (М<<К) многомерных описаний, проводим на них процедуру обучения алго­ритма. Точность обучения характеризует валидность теста. После это­го применяем процедуру собственно распознавания (по выработан­ному решающему правилу) для остальных К-М описаний. В резуль­тате этой процедуры мы определяем принадлежность респондентов (испытуемых) к этим классам. Сравнивая полученные результаты с эталонными данными о принадлежности испытуемых к классам, мы определяем точность самого распознавания. Если эта точность близ­ка к точности обучения, то наша пилотажная выборка объемом М может быть признана репрезентативной для обучения. Теперь можно переходить к задаче определения информационных весов.

 

*  *  *

Для эффективного использования алгоритмов распознавания по отношению к многомерным тестовым системам (при K>3), как пра­вило, требуется использование компьютера.                       

При решении задач небольших размерностей (по количеству па­раметров) иногда психолог может быстрее найти решающее прави­ло, применяя собственные способности зрительной системы (очень мощные) к визуально-геометрической группировке объектов. В про­странстве параметров диагностические, классы выглядят как «сгуще­ния», некие «облака» из точек, изображающих испытуемых. В этом случае при наличии априорной информации о принадлежности ин­дивидов к классам удобно изображать точки из различных классов разными цветами (хуже - квадратиками, кружками, треугольниками). В этом случае «решающее правило» легко «увидеть» как некую вооб­ражаемую линию (прямую или кривую), разделяющую точки разного цвета (рис. 17). Точность диагностики в данном случае можно оценить по количеству точек, попавших при данном решающем правиле в «чужую» половину пространства параметров.

 

 

Рис.17. Разделение двух классов объектов (изображены кружками и треугольниками) в пространстве двух параметров X1, и Х2

Точность правила, изображенного на рис. 17, равна:

                                  

10

2

  3

12

  A                        

B

Здесь в четырехклеточной матрице сопряженности по строкам за­дано попадание объекта в один из априорных классов А (треугольни­ки на рис. 17) или В (кружочки на рис. 17), а по столбцам - попадание объектов в один из апостериорных классов, образованных примене­нием решающего правила, -  (слева от критериальной линии) или  (справа от критериальной линии). Как указано выше, для статис­тической оценки точности может быть использован фи-коэффициент, связанный по известной формуле с критерием хи-квадрат.

 

3.6. ТРЕБОВАНИЯ К ПСИХОМЕТРИЧЕСКОЙ ПОДГОТОВКЕ ПСИХОЛОГА

 

Для эффективного развития практической психодиагностики сегодня требуется резкое повышение психометрической культуры всех психологов, использующих измерительные психодиагности­ческие методики. Методами рестандартизации теста, простейши­ми приемами проверки надежности и валидности должны владеть все психологи.

До сего дня сохранилось не вполне оправданное разделение (и даже противопоставление) психологов, считающих себя специалис­тами в области клинических методов, и психологов, считающих себя специалистами по тестированию. Но в большинстве реальных прак­тических ситуаций требуется сочетание этих методов. Клинические, диалогические методы необходимы на начальных этапах работы в заданной области для того, чтобы психолог сумел построить ясное содержательное представление о предмете психодиагностики. Они также необходимы в особых спорных случаях, требующих индивиду­ализированного подхода. Но когда от психолога требуется проведе­ние ускоренных, массовых обследований, обращение к некоторым стандартизованным, измерительным методикам становится неизбеж­ным. Здесь требуется психометрическая грамотность в подборе тако­го рода методик: нельзя использовать методики, о которых неизвест­но, какого рода психометрической отладке они подвергались.

Всеобщая психометрическая грамотность психологов не исклю­чает выделения из их среды специалистов особого рода - психологов-психометристов, профессионально занимающихся психометри­ческим обеспечением психодиагностики. Поэтому целесообразно привести здесь два списка нормативных требований - к психологу и к психологу-психометристу.

Требования к психологу:

1. Психолог должен уметь квалифицированно разбираться с пси­хометрической документацией в методической литературе по психо­диагностике, должен знать, какие психометрические характеристики теста должны указать его разработчики, в какой степени эти психо­метрические характеристики соответствуют типу теста, с одной сто­роны, и актуальной задаче, для которой его требуется использовать, с другой. Например, в тех случаях, когда требуется использовать тест для прогноза со значительным упреждением, а сведений о проверке прогностической валидности не получено, тест не может считаться готовым для решения данной задачи.

2. Психолог должен правильно определить, в какой мере извест­ные тестовые нормы по требующейся методике применимы в его си­туации с учетом контингента испытуемых и типа диагностической си­туации, существует ли ситуация «внутрикультурного переноса» и нуж­на ли рестандартизация тестовых норм. При необходимости психолог должен уметь самостоятельно практически произвести рестандартизацию, построив и проанализировав распределение тестовых баллов.

3. Психолог должен уметь самостоятельно собирать данные, прово­дить корреляционную обработку и измерять эмпирическую валидность -эффективность методики по отношению к заданному критерию. При необходимости психолог должен уметь самостоятельно конкретизиро­вать операциональные индикаторы критериальной информации.

4. Психолог должен уметь самостоятельно определять появление слишком высокой погрешности в результатах, утрату методикой не­обходимого уровня надежности, при этом проверять свою гипотезу статистически.

5. Психолог обязан вести двойную документацию: все копии про­токолов он должен быть готов передать в головную методическую организацию (научно-академическую или отраслевую) для пополне­ния общего банка данных и совершенствования психометрических характеристик методики. Все модификации, вносимые в методику (формулировку инструкции, отдельных вопросов, последовательность предъявления), психолог должен согласовывать с головной методи­ческой организацией, так как самодеятельное введение на местах раз­нообразных частных модификаций влечет за собой утрату психомет­рической чистоты получаемых результатов, не ускоряет, а замедляет создание модификаций, адаптированных к специфическим условиям и обладающих необходимыми психометрическими свойствами. Тща­тельное соблюдение заданных методических стандартов — необходи­мый атрибут психометрической культуры психолога.

6.  Психолог должен уметь самостоятельно выявлять и измерять уровень мотивационных искажений, обусловливающих фальсифика­цию тестовых данных испытуемыми, должен уметь корректно отсеи­вать недостоверные протоколы, статистически фиксировать достиже­ние приемлемого уровня достоверности для массовых результатов в групповой психодиагностике.

7. Психолог должен овладевать приемами сложного количествен­ного подсчета косвенных тестовых показателей, а также интегральных показателей, требующих агрегирования многообразной числовой ин­формации. Он должен уметь поставить задачу программисту (или психологу-психометристу) для проведения расчетов на компьютере.

Психолог-психометрист должен уметь:

1. Самостоятельно планировать и осуществлять все этапы по пси­хометрическому конструированию или адаптации психодиагностичес­ких методик: проверку надежности и валидности на уровне отдель­ных пунктов теста, отсев ненадежных и невалидных пунктов, пост­роение и анализ распределения тестовых баллов, составление мате­матических уравнений для прогнозирования или «решающего правила» для распознавания.

2. Организовывать хранение и обработку психодиагностических данных на компьютере, владеть навыками работы на компьютере в рамках стандартных операционных систем, знать структуру исполь­зуемых в психодиагностике баз данных и уметь управлять базами дан­ных.

3. Организовать работу психологов-психодиагностов по ведению документации к используемым методикам, по соблюдению методи­ческих стандартов, по сведению и интеграции результатов в общие банки психодиагностической информации.

4. Вести картотеку методик в рамках заданной области (отрасле­вой психологической службы), тщательно иерархизируя методики по уровню психометрической обеспеченности, вести библиотеку мето­дических материалов и методических рекомендаций по использова­нию стандартизованных методик.

В заключение отметим, что развивающаяся психодиагностичес­кая практика неизбежно расширит приведенные здесь перечни тре­бований..

 

 

 

 

 

 

содержание   ..  1  2  3  4  ..