Медико-биологическая статистика - часть 16

 

  Главная      Учебники - Медицина     

 

поиск по сайту            правообладателям  

 

 

 

 

 

 

 

 

 

содержание   ..  14  15  16  17   ..

 

 

Медико-биологическая статистика - часть 16

 

 

234
ГЛАВА 8
Таблица. 8.1. Расчет параметров уравнения регрессии
X
Y
Х2
XY
31
7,8
961
241,8
32
8,3
1024
265,6
33
7,6
1089
250,8
34
9,1
1156
309,4
35
9,6
1225
336,0
35
9,8
1225
343,0
40
11,8
1600
472,0
41
12,1
1681
496,1
42
14,7
1764
617,4
46
13,0
2116
598,0
369
103,8
13841
3930,1
Рассчитаем параметры уравнения регрессии для нашей вы-
борки из 10 марсиан. Вспомогательные величины для вычисле-
ний приведены в табл. 8.1. Объем выборки п = 10, ΣX = 369,
ΣY = 103,8, ΣX2 =13841 и ΣXY = 3930,1. Подставим эти числа в
формулы для коэффициентов регрессии:
103,8×13841−369×3930,1
a
=
=−6, 0
2
10×13841−369
и
10×3930,1−369×103,8
b
=
=
0, 44.
2
10×13841−369
Таким образом, прямая регрессии имеет вид:
ŷ=−6,0+0,44x.
Именно это уравнение задает прямую IV.
Разброс значений вокруг прямой регрессии
Мы получили а и b — оценки коэффициентов регрессии α и β.
Хорошо бы получить также оценку разброса значений вокруг
прямой регрессии. При каждом значении X стандартное откло-
нение постоянно и равно σy|x. Выборочной оценкой σy|x служит
АНАЛИЗ ЗАВИСИМОСТЕЙ
235
Y
(
a+bX
2
s
=
,
y|x
n−2
где а + bХ — значение уравнения регрессии в точке X,
Y - (а + bХ) — расстояние от точки до прямой регрессии, Σ обоз-
начает суммирование квадратов этих расстояний. Не будем объ-
яснять, почему сумма квадратов отклонений должна быть поде-
лена на п - 2, а не на п или п - 1. Скажем только, что причина
аналогична той, по которой в оценке стандартного отклонения
делитель равен п - 1.
Величина sy|x называется остаточным стандартным откло-
2
нением (соответственно
s
, называется остаточной диспер-
y|x
сией). Связь sy|x со стандартными отклонениями SY и sX зависи-
мой и независимой переменных определяется формулой
n
−1
2
2
2
s
=
s
−b
s
y|x
(
Y
X
)
n−2
Для рассмотренной нами выборки sX = 5,0, sY = 2,4. Тогда
9
2
2
2
s
=
(
2, 4
−0, 44
×5,0
)
=1,02.
y|x
8
Как видим, оценка sy|x оказалась близкой к истинному зна-
чению σy|x, равному 1,0 г.
Стандартные ошибки коэффициентов регрессии
Подобно тому как выборочное среднее — это оценка истинного
среднего (среднего по совокупности), так и выборочные пара-
метры уравнения регрессии a и b — не более чем оценки истин-
ных коэффициентов регрессии α и β. Разные выборки дают раз-
ные оценки среднего — точно так же разные выборки будут да-
вать разные оценки коэффициентов регрессии. Для выборки с
рис. 8.3 мы получили значения а = -6,0 и b = 0,44. Рассмотрим
другую выборку из той же совокупности (рис. 8.6А). На рис. 8.6Б
эта выборка показана такой, какой ее видит исследователь. Об-
щая закономерность осталась прежней — высокие марсиане ве-
236
ГЛАВА 8
Рис. 8.6. А. Еще одна случайная выборка объемом 10 из совокупности марсиан. Марси-
ане, попавшие в выборку, помечены точками.
АНАЛИЗ ЗАВИСИМОСТЕЙ
237
Рис. 8.6. Б. Линия регрессии, рассчитанная по этой выборке, несколько отличается от
полученной ранее (см. рис. 8.5Б). Серым показана линия средних с рис. 8.2.
238
ГЛАВА 8
сят больше низкорослых. Однако, рассчитав коэффициенты ре-
грессии, получим а = -4,0 г и b = 0,38 г/см.
Если построить все возможные выборки по 10 марсиан в каж-
дой, получится совокупность всех значений а и b. Их средние
равны α и β, а стандартные отклонения — σα и σβ. Эти стандарт-
ные отклонения называются стандартными ошибками коэффи-
циентов регрессии. Стандартные ошибки коэффициентов рег-
рессии, подобно стандартной ошибке среднего или доли, ис-
пользуются при проверке гипотез и вычислении доверительных
интервалов. Выборочные оценки для σα и σβ обозначаются со-
ответственно sa и sb и вычисляются по следующим формулам*:
2
1
X
s
=
s
+
a
y|x
2
n
(
n
−1
)
s
X
и
1
s
y|x
s
b
=
n−1
s
X
Для выборки с рис. 8.3Б имеем:
2
1
36,9
s
=1, 02
+
=
2,53
a
2
10
(
10−1
)
5, 0
и
1
1,02
s
=
=0,068.
b
10
1 5,0
Стандартные ошибки коэффициентов регрессии использу-
ются аналогично стандартной ошибке среднего — для нахожде-
ния доверительных интервалов и проверки гипотез.
* Вывод формул для стандартных ошибок коэффициентов регрессии мож-
но найти в большинстве учебников статистики. См., например, J. Neter
and W. Wasserman. Applied statistical models. Irwin, Home-wood, III., 1974,
chap. 3, «Inferences in regression analysis».
АНАЛИЗ ЗАВИСИМОСТЕЙ
239
Есть ли зависимость?
Помня о досадном недоразумении с «диуретиком» из гл. 1 (см.
рис. 1.2), исследователь вправе спросить: как убедиться, что за-
висимость действительно существует? Иными словами, как по
выборочным данным определить вероятность Р нулевой гипоте-
зы о том, что коэффициент наклона β = 0*?
Совокупность всех выборочных значений коэффициента на-
клона b приближенно подчиняется нормальному распределению.
Поэтому можно воспользоваться критерием Стьюдента, анало-
гично тому, как мы пользовались им в гл. 4 для проверки гипоте-
зы относительно среднего. В общем виде критерий Стьюдента
можно определить как:
Выборочная оценка − Истинная величина
t
=
Стандартная ошибка выборочной оценки
Для оценки коэффициента наклона:
b
−β
t
=
s
b
Оценить вероятность гипотезы о равенстве β = 0 можно дву-
мя способами.
Приравняв β к нулю, имеем
b
t
=
s
b
Теперь по табл. 4.1 найдем tα — критическое значение t для вы-
бранного уровня значимости α и числа степеней свободы ν = п - 2.
Если полученное значение t по абсолютной величине превосхо-
дит tα, то Р < α, то есть зависимость статистически значима.
Потренируемся на марсианах. Для выборки с рис. 8.3Б мы на-
шли b = 0,44 и sb = 0,068 Тогда t = 0,44/0,068 = 6,47. Объем выбор-
ки равен 10. Положим уровень значимости равным 0,001. В табл.
4.1 для этого уровня значимости и числа степеней свободы
* Речь идет исключительно о линейной зависимости. Как мы вскоре уви-
дим, зависимость может быть и нелинейной; в таком случае излагаемый
способ даст неправильный результат.
240
ГЛАВА 8
ν = 10 - 2 = 8 находим критическое значение tα = 5,041. По-
скольку t > tα, гипотезу об отсутствии зависимости веса от рос-
та следует отвергнуть.
Конечно, как и всегда при проверке гипотез, это заключение
может оказаться ложным (опять-таки вспоминается злополуч-
ный диуретик из гл. 1). Но вероятность совершить эту ошибку
не превышает 0,001.
Второй способ основан на использовании доверительных ин-
тервалов. 100(1 - α)-процентный доверительный интервал для β
имеет вид
b−tαs
<β<
b+tαs
b
b
Рассчитаем 95% доверительный интервал. Число степеней
свободы ν = 10 - 2 = 8. По таблице 4.1 находим t0,05 = 2,306.
Выборочные значения b = 0,44 и sb = 0,068. Следовательно,
доверительный интервал для β:
0, 44−2,306×0,068<β<
0, 44+
2,306×0,068,
0, 28<β<
0,60.
Поскольку ноль в этот интервал не попадает, вероятность то-
го, что β = 0, меньше 5%.
Если рассчитать 99,9% доверительный интервал, можно убе-
диться, что и он не содержит нуля. Вывод, полученный выше
при использовании критерия Стьюдента, как и следовало ожи-
дать, совпадает с полученным с помощью доверительного ин-
тервала. Заметим, что истинное значение β = 0,5 попадает в
доверительный интервал.
Можно вычислить доверительный интервал и для коэффици-
ента α. Например, 95% доверительный интервал имеет вид:
a−t
s
<α<a+t
s
,
0,05
a
0,05
a
то есть
−6,0−2,306×2,53<α<−6,0+
2,306×2,53,
−11,8<α<−0,17.
Интервал покрывает истинное значение α = -8 г.
АНАЛИЗ ЗАВИСИМОСТЕЙ
241
Следующим этапом будет построение доверительной области
для линии регрессии и значений зависимой переменной.
Доверительная область для линии регрессии
Обычно мы не знаем истинных величин коэффициентов регрес-
сии α и β. Нам известны только их оценки а и b. Иначе говоря,
истинная прямая регрессии может пройти выше или ниже, быть
более крутой или пологой, чем построенная по выборочным
данным. Мы вычислили доверительные интервалы для коэффи-
циентов регрессии. Можно вычислить доверительную область
и для самой линии регрессии. На рис. 8.7А показана 95% довери-
тельная область для выборки с рис. 8.3. Как видим, это доволь-
но узкая полоса, которая несколько расширяется при крайних
значениях х.
Мы знаем, что при любом значении независимой перемен-
ной х соответствующие значения зависимой переменной у рас-
пределены нормально. Средним является значение уравнения
регрессии
ŷ . Неопределенность его оценки характеризуется
стандартной ошибкой регрессии:
2
1
(
x− X
)
s
=
s
+
y
y|x
2
n
(
n−1
)
s
X
В отличие от стандартных ошибок, с которыми мы имели
дело до сих пор,
s
при разных х принимает разные значения:
ŷ
чем дальше х от выборочного среднего X , тем она больше.
Теперь можно вычислить 100(1 - α)-процентный доверитель-
ный интервал для значения уравнения регрессии в точке х:
y
tαs
<
y< y
+
tαs
,
y
y
где tα — критическое значение с ν = n - 2 степенями свободы, а
ŷ
— значение уравнения регрессии в точке х:
ŷ=a+bx.
Итак, мы получили уравнение для кривых, ограничивающих
доверительную область линии регрессии (см. рис. 8.3). С задан-
ной вероятностью, обычно 95%, можно утверждать, что истин-
242
ГЛАВА 8
Рис. 8.7. А. 95% доверительная область для линии регрессии (по выборке с рис. 8.3).
ная линия находится где-то внутри этой области. Обратите вни-
мание, что три точки из десяти оказались вне доверительной
области. Это совершенно естественно, поскольку речь идет о
доверительной области линии регресии, а не самих значений
(доверительная область для значений гораздо шире).
Авторы медицинских публикаций нередко приводят довери-
тельную область линии регрессии и говорят о ней так, как будто
это — доверительная область значений. Это примерно то же са-
мое, что выдавать стандартную ошибку среднего за характеристику
разброса значений, путая ее со стандартным отклонением. Напри-
мер, из рис. 8.7А видно, что средний вес марсиан ростом 40 см
с вероятностью 95% окажется между 11,0 и 12,5 г — из этого
АНАЛИЗ ЗАВИСИМОСТЕЙ
243
Рис. 8.7. Б. 95% доверительная область для значений. Если мы хотим определить вес
марсианина по его росту, нам следует воспользоваться именно этой доверительной
областью.
вовсе не следует, что в этих пределах окажется вес 95% марси-
ан такого роста.
Теперь займемся доверительной областью для значений зави-
симой переменной.
Доверительная область для значений
Разброс значений складывается из разброса значений вокруг
линии регресии и неопределенности положения самой этой ли-
нии. Характеристикой разброса значений вокруг линии регрессии
является остаточное стандартное отклонение sy|x, а неопределен-
244
ГЛАВА 8
ности положения линии регрессии — стандартная ошибка рег-
рессии
s
. Дисперсия суммы двух величин равна сумме диспер-
ŷ
сий, поэтому
2
2
s
=
s
+s
Y
y|
x
y .
Подставив в эту формулу выражение для
s
ŷ
из предыдущего
раздела, получим:
2
1
(
x− X
)
s
=
s
1+
+
Y
y|x
2
n
(
n−1
)
s
X
Тогда 100(1 - α)-процентный доверительный интервал для
зависимой переменной
y
tαs
<
y< y
+
tαs
Y
Y
Заметьте, что входящие в это неравенство величины
ŷ и sY
зависят от х.
На рис. 8.7Б изображена полученная по этой формуле 95%
доверительная область для значений зависимой переменной. В
эту область попадет 95% всех возможных значений веса марси-
ан любого роста. Например, с вероятностью 95% можно утвер-
ждать, что любой 40-сантиметровый марсианин весит от 9,5 до
14,0г.
СРАВНЕНИЕ ДВУХ ЛИНИЙ РЕГРЕССИИ
Часто требуется сравнить линии регрессии, рассчитанные по
двум выборкам. Это можно сделать тремя способами.
• Сравнить коэффициенты наклона b,
• Сравнить коэффициенты сдвига a.
• Сравнить линии в целом.
В первых двух случаях следует воспользоваться критерием
Стьюдента. Если нужно проверить, значимо ли различие в на-
клоне двух прямых регрессии, критерий Стьюдента t вычисляет-
ся по формуле:
АНАЛИЗ ЗАВИСИМОСТЕЙ
245
b
−b
1
t
=
2 ,
s
b
−b
1
2
где b1 - b2 — разность коэффициентов наклона, a
s
b
−b
— ее стан-
1
2
дартная ошибка. Затем вычисленное t сравним, как обычно, с кри-
тическим значением tα, имеющим (n - 2) + (n - 2) = n1 + n2 - 4
степени свободы.
Если обе регрессии оценены по одинаковому числу наблюде-
ний, то стандартная ошибка разности
2
2
s
=
s
+
s
b
1
−b
2
b1
b
2
Если же объемы выборок различны, следует воспользовать-
ся объединенной оценкой остаточной дисперсии (она аналогична
объединенной оценке дисперсии, приведенной в гл. 4):
2
2
(
n
−2
)
s
+
(
n
−2
)
s
2
1
y|x
1
2
y|x
2
s
=
y|x
общ
n
+
n
−4
1
2
Тогда формула для
s
принимает вид
b
1
−b
2
2
2
s
s
y|x
общ
y|x
общ
s
=
+
b
1
−b
2
2
2
(
n
1
−1
)
s
x
(
n
2
−1
)
s
x
1
2
Можно сравнить и коэффициенты сдвига a1 и а2. В этом
случае
a
−a
1
t
=
2 .
s
a
1
−a
2
Здесь
2
2
s
=
s
+
s
,
a
1
−a
2
a
1
a
2
когда обе регрессии вычислены по одинаковому числу точек.
При неодинаковом числе точек следует воспользоваться объеди-
ненной оценкой дисперсии так же, как это было сделано выше.
Перейдем к сравнению двух линий регресии в целом. Срав-
нить две линии регрессии — значит оценить вероятность нуле-
246
ГЛАВА 8
вой гипотезы о совпадении линий*. Напомним, что коэффици-
енты регрессии вычисляются так, чтобы разброс точек вокруг
линии регрессии был минимален. Разброс этот характеризуется
2
остаточной дисперсией
s
: чем меньше остаточная дисперсия,
y|x
тем лучше прямая регрессии соответствует имеющимся точкам.
Воспользуемся этим показателем для оценки результатов тако-
го мысленного эксперимента. Объединим обе выборки в одну и
построим для нее линию регрессии. Если линии регрессии для
двух выборок близки, остаточная дисперсия при этом существен-
но не изменится. И наоборот, если они различаются, то совпа-
дение точек и линии ухудшится и остаточная дисперсия возрас-
тет. Порядок действий таков.
Построить прямую регресии для каждой из выборок.
2
2
По остаточным дисперсиям
s
и
s
каждой из регрессий
y|x
1
y|x
2
2
вычислить объединенную оценку остаточной дисперсии
s
y|x
общ
Объединить обе выборки. Построить прямую регрессии для
получившейся выборки и вычислить остаточную дисперсию
2
s
y|x
един
Вычислить «выигрыш» от использования двух раздельных
регрессий. Мерой выигрыша служит величина:
2
2
(
n
+
n
−2
)
s
(
n
+
n
−4
)
s
2
1
2
y|x
един
1
2
y|x
общ
s
=
y|x
в
2
2
2
По
s
и
s
вычислить критерий F:
y|x
в
y|x
общ
2
s
y|x
в
F
=
2
s
y|x
общ
Сравнить вычисленное значение с критическим значением
F для числа степеней свободы νмеж = 2 и νвну = n1 + n2 - 4. Если
полученное значение больше критического, то гипотеза о
совпадении линий регрессии должна быть отклонена.
*
Методы, предназначенные для сравнения более чем двух линий регрессии,
описаны в книге: J. H. Zar. Biostatistical analysis. 2nd ed. Prentice-Hall.
Englewood Cliffs. N. J.. 1984.
АНАЛИЗ ЗАВИСИМОСТЕЙ
247
Рис. 8.8. Зависимость мышечной силы от мышечной массы. Здоровые обозначены круж-
ками, больные ревматоидным артритом — квадратиками. Одинакова ли зависимость у
больных и здоровых?
Мышечная сила при ревматоидном артрите
Причины ограниченной подвижности при ревматоидном артрите
разнообразны: болезненность суставов, их тугоподвижность,
атрофия мышц. Каков вклад каждого из этих факторов? Пыта-
ясь ответить на этот вопрос, П. С. Хелливелл и С. Джексон*
исследовали, в частности, связь между мышечной массой и си-
лой. В исследовании приняли участие 25 больных ревматоид-
ным артритом (1-я группа) и 25 здоровых (2-я группа). Рассчи-
тывали площадь поперечного сечения предплечья и ручным
динамометром определяли силу сжатия кисти. Результат пока-
зан на рис. 8.8. Кружки — результаты здоровых, квадратики —
больных ревматоидным артритом.
На рис. 8.9А представлены те же наблюдения, что и на рис.
8.8, и кроме того, две построенные по ним линии регрессии.
Проверим, есть ли значимое различие между линиями регрес-
* P. S. Helliwell, S. Jackson. Relationship between weakness and muscle wasting
in rheumatoid arthritis. Ann. Rheum. Dis., 53:726—728, 1994.
248
ГЛАВА 8
Рис. 8.9. А. Построим линии регрессии для каждой из групп и оценим разброс
точек относительно этих линий. Б. Объединим группы и найдем линию регрес-
сии для получившейся группы. Если разброс точек относительно этой линии зна-
чительно превышает разброс относительно двух отдельных линий, то различия
линий следует считать значимыми.

 

 

 

 

 

 

 

содержание   ..  14  15  16  17   ..