Статистика строится на простой предпосылке: вы не можете измерить всё, поэтому вы измеряете её часть. Вы берёте выборку. Вы вычисляете среднее значение. Вы утверждаете, что оно представляет собой всю совокупность. Но вот в чём подвох. Это среднее значение никогда не бывает абсолютно точным.

Разница между оценкой, полученной из выборки, и истинным параметром генеральной совокупности называется ошибкой выборки. Это разрыв между тем, что вы думаете, что знаете, и тем, что на самом деле является истиной. Этот разрыв существует, потому что выборка — это лишь доля совокупности. Это не весь пирог целиком. Это лишь кусочек. И кусочки редко идеально совпадают с целым.

Почему возникает ошибка выборки

Представьте себе старшую школу с 1000 учениками. Если вы спросите только десяти учеников об их любимом блюде в столовой, ваш результат, скорее всего, будет искажён. Возможно, эти десять учеников обожают пиццу. Вся школа может предпочитать салаты. Расхождение между «предпочтением пиццы», выявленным в вашем опросе, и реальными предпочтениями школы и есть ошибка выборки.

Это не ошибка. Это не баг. Это математическая неизбежность. Ошибка выборки возникает всякий раз, когда вы оцениваете параметр на основе подмножества данных. Она исчезает только тогда, когда вы измеряете всю совокупность целиком. Перепись населения имеет нулевую ошибку выборки, потому что включены абсолютно все единицы данных. Когда вы включаете всех, оценка становится истиной.

Но у нас редко есть время или деньги для переписи миллионов людей. Поэтому мы используем выборку. И мы живём с этой ошибкой.

Что делает ошибку выборки больше или меньше?

Не все ошибки выборки одинаковы. Некоторые исследования более точны, чем другие. Размер этого разрыва определяют несколько факторов.

Размер выборки
Это самый очевидный фактор. Существует обратная зависимость между размером выборки и ошибкой выборки. Большая выборка приводит к меньшей ошибке. Если вы опросите 1000 человек вместо 10, ваша оценка будет ближе к истинному среднему значению совокупности. По мере того как размер выборки приближается к размеру всей совокупности, стандартная ошибка стремится к нулю. Она никогда не достигает нуля, если только у вас нет данных обо всей совокупности.

Изменчивость совокупности
Если все члены совокупности имеют одинаковое значение, выборка любого размера будет идеальной. Ошибки не будет. Но реальные совокупности сложны. Они варьируются. Чем больше изменчивость значений в совокупности, тем выше вероятность того, что ваша выборка будет нерепрезентативной. Высокая изменчивость означает большую ошибку выборки.

Как методы выборки меняют дело

То, как вы выбираете свою выборку, имеет значение. Сам метод может усиливать или уменьшать ошибку.

Стратифицированная выборка может помочь. Этот метод делит совокупность на однородные подгруппы (страты) и выбирает элементы из каждой. Если вы хотите отразить мнения в стране, вы можете стратифицировать по возрасту или региону. Обеспечивая представленность каждой подгруппы, вы снижаете влияние высокой изменчивости. Это приводит к уменьшению ошибки выборки.

Кластерная выборка отличается от неё. Здесь вы делите совокупность на кластеры (например, городские кварталы) и случайным образом выбираете целые кластеры для опроса. Это дешевле и проще. Но это может привести к большей ошибке выборки. Почему? Потому что кластеры могут не равномерно охватывать разнообразие совокупности. Вы можете выбрать кластеры, которые слишком похожи друг на друга. Выборка становится менее репрезентативной. Ошибка возрастает.

Измерение неопределенности

Как мы количественно оцениваем этот разрыв? Мы используем стандартную ошибку.

Стандартная ошибка — это мера того, насколько оценка, как ожидается, будет отличаться от истинного параметра. Она аналогична стандартному отклонению всех возможных выборок. Чтобы рассчитать оценку стандартной ошибки, нужно взять стандартное отклонение выборки и разделить его на квадратный корень из размера выборки.

«Стандартная ошибка обеспечивает количественную меру того, насколько оценка, как ожидается, будет отличаться от истинного параметра генеральной совокупности.»

На основе стандартной ошибки выводится доверительный интервал (или погрешность). Доверительный интервал предоставляет диапазон. Он говорит вам, что истинный параметр, вероятно, находится в пределах определенного интервала. Доверительный интервал не дает фиксированного значения для ошибки выборки. Вместо этого он зависит от уровня доверия. Уровень доверия 95% означает, что если вы повторите исследование 100 раз, истинный параметр попадет в ваш доверительный интервал 95 раз.

Другой вид ошибки

Ошибка выборки — это только половина истории. Она отличается от несистематической ошибки (ошибки, не связанной с выборкой).

Несистематическая ошибка включает все остальные неточности. Она не вызвана тем фактом, что вы взяли подмножество данных. Она вызвана несовершенными методами. Эти ошибки снижают точность так же сильно, как и ошибка выборки. Но вы не можете исправить их, увеличив размер выборки.

Несистематические ошибки делятся на две категории:
* Систематические ошибки: Они смещают результаты в одном направлении.
* Случайные ошибки: Они искажают результаты случайным образом, но обычно компенсируют друг друга со временем.

Распространенные источники несистематических ошибок включают:
* Ошибка покрытия: Пропуски, дубликаты или неправильная классификация единиц выборки.
* Смещение отбора: Создание нерандомизированной выборки, которая не является репрезентативной.
* Методологические недостатки: Плохо спроектированные опросы.
* Ошибки при обработке данных: Ошибки при вводе или расчете данных.
* Неправильная интерпретация: Неправильное чтение результатов.

Итог

Ошибка выборки — это цена научной работы без измерения всего. Это цена вывода (инференции). Вы можете управлять ею. Вы можете уменьшить её, увеличив размер выборки. Вы можете уменьшить её, выбрав лучшие методы выборки, такие как стратификация. Вы можете количественно оценить её с помощью стандартной ошибки и доверительного интервала.

Но вы не можете устранить её полностью. Не если только вы не измерите всех. И даже в этом случае вам придется беспокоиться о несистематической ошибке. Данные никогда не бывают чистыми. Они всегда являются приближением. И это нормально. Пока вы понимаете этот разрыв, вы можете им управлять. Вопрос не в том, идеальны ли ваши данные. Вопрос в том, насколько велик этот разрыв. И готовы ли вы с ним мириться.