Единица 3 / 11

Выборка, репрезентация и предвзятость

Прибыль:

  • Способность четко определить совокупность и оценить репрезентативность метода выборки и того, кто систематически исключается
  • Способность различать предвзятость данных и стереотипы, переносимые искусственным интеллектом, и контролировать и то, и другое.
  • Умение выражать выводы, ограниченные выборкой, без преувеличения, и писать честный раздел об ограничениях.

Наиболее важной концепцией социального исследования является выборка — то есть подгруппа, которую вы выбираете, потому что вы не можете изучить всю интересующую вас группу (вселенная/население: все люди или единицы, о которых хочет поговорить исследование) один за другим. На кого можно обобщить результаты исследования (т. е. «действителен ли этот результат только для этих людей или для более широкой группы») полностью зависит от репрезентативности выборки. Результат неправильной или предвзятой выборки неправильный, независимо от того, насколько хорошо она проанализирована. В этом модуле вы узнаете, как использовать ИИ для обдумывания структуры выборки, выявления систематической ошибки — систематического отклонения данных или интерпретации в одном направлении, а также честно выражать пределы обобщения.

Здесь необходимо различать два типа предрассудков. Во-первых, это предвзятость данных: в выборке перепредставлена ​​одна группа и недопредставлена ​​другая (например, те, кто может участвовать только в онлайн-опросе, т.е. те, кто имеет доступ к Интернету). Второе — это собственная предвзятость ИИ: ИИ несет в себе шаблоны текстов, на которых он был обучен, и может производить стереотипные обобщения о социальной группе. Хороший социальный исследователь должен учитывать и то, и другое; ИИ может помочь вам распознать и то, и другое, а может усилить и то, и другое.

Шаг за шагом: думаем о представительстве

1. Опишите Вселенную. Кому вы хотите рассказать о своей находке? «Все избиратели в Турции» и «молодые избиратели в районе Стамбула» — это совершенно разные вселенные. Образец не может быть установлен без четкого указания этого.

2. Выберите метод отбора проб. Такие методы, как случайный (все имеют равные шансы быть выбранными), стратифицированный (разделение вселенной на группы и выбор из каждой группы), снежный ком (один участник рекомендует другого) дают разные возможности представительства. ИИ может объяснить плюсы и минусы каждого метода простым языком.

3. Спросите, кто остался в стороне. В каждой выборке кого-то не хватает. Онлайн-опрос не учитывает тех, у кого нет Интернета, телефонный опрос не учитывает тех, у кого нет стационарного телефона, дневное интервью не учитывает сотрудников. ИИ составляет хороший контрольный список «кого систематически исключает этот метод?»

4. Составьте карту источников предвзятости. Перечислите источники, такие как предвзятость выбора (кто выбран), предвзятость ответа (кто отвечает), предвзятость воспоминаний (неправильное запоминание прошлого).

5. Напишите предел обобщения. Сформулируйте результат как «молодые люди в этой выборке», а не «все подростки». ИИ может заметить чрезмерные обобщения в вашем проекте.

Совет: хороший исследовательский отчет усиливается, а не ослабляется разделом «ограничения». Если честно писать о том, кого не представляет ваша выборка, это сделает ваше исследование более надежным. Попросите ИИ составить проект этого раздела, но подтвердите любые ограничения самостоятельно.

три мини-кейса

Случай 1 — Скрытая систематическая ошибка отбора. Чтобы измерить удовлетворенность услугами муниципалитета, одна группа разместила опрос на веб-сайте муниципалитета и обнаружила удовлетворенность 78%. Когда я спросил у AI «кого не хватает в этой выборке?», оказалось, что тот сегмент, который уже пользуется сайтом (то есть имеет доступ к сервису и, вероятно, более удовлетворен), перепредставлен. Результат был исправлен до «78% среди пользователей сайта».

Случай 2 — Стереотип ИИ. Когда исследователь попросил ИИ обобщить «взгляды сельских пожилых людей на технологии», ИИ добавил стереотипную рамку, которой не было в данных, например, «пожилые люди боятся технологий». Когда исследователь понял это и сказал: «Просто полагайтесь на утверждения в стенограмме», выяснилось, что в данных на самом деле присутствует большое разнообразие взглядов.

Случай 3. Коррекция стратифицированной выборки. В выборке из 500 человек женщины составляли 30% по сравнению с 51% населения. ИИ объяснил логику взвешивания простым языком, и команда взвесила результаты в соответствии с пропорциями населения, что привело к более репрезентативной картине.

Четыре копируемых шаблона

1) Критика образца:

Вселенная моего исследования: [описание]. Мой метод выборки: [метод]. Ваша задача: составить список тех, кого эта выборка может систематически занижать или перепредставлять. Рассмотрим ошибки выбора, ответа и припоминания отдельно. Дайте рекомендации по смягчению каждого риска. Не преувеличивайте мое открытие; Честно показывайте границы.

2) Контроль обобщения:

Изучите эти поисковые предложения: [текст]. Отметьте каждое чрезмерное обобщение. Замените такие утверждения, как «все/каждый/молодые люди/женщины», на более узкое утверждение, которое действительно подтверждается данными. Например, вместо «молодые люди делают X» написано «Y% подростков в этой выборке сообщили X». Отмечайте любые претензии неопределенного происхождения.

3) Улов предвзятости ИИ:

Я дал вам резюме ниже. Проверьте: ДЕЙСТВИТЕЛЬНО ли присутствуют в данном тексте добавленные вами суждения, прилагательные или обобщения? Отметьте и удалите все выражения, которых нет в тексте, но которые взяты из ваших собственных шаблонов. Просто придерживайтесь того, что написано в тексте.

4) Проект раздела ограничений:

Напишите черновой вариант раздела «Ограничения» на основе следующей информации о методе: размер выборки [n], метод [x], контекст [y]. Объясните, как каждое ограничение может повлиять на результаты. Ни преувеличения, ни недооценки; Будьте уравновешены и честны. Я подтвержу каждый товар.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

По результатам моего опроса, такого мнения придерживается большинство молодых людей. Напишите это в сильном предложении.

Это приводит к чрезмерному обобщению, даже не подвергая сомнению выборку. ИИ легко впадает в утверждение, которое не соответствует данным, например: «Молодые люди в Турции…»

Мощная подсказка:

Моя выборка: 220 студентов бакалавриата одного университета, онлайн-опрос, добровольное участие. Я хотел бы высказать вывод: 61% участников выразили мнение X. Напишите это простым академическим предложением, в котором четко указаны границы выборки (представительность, предвзятость волонтерства). Ограничьте обобщение этим образцом.

Разница: второе предложение содержит обоснованное утверждение, которое действительно подтверждается данными.

Методы выборки и репрезентативность

Метод

Как это работает

представительская власть

Типичный риск

простой случайный

Равные шансы для всех

высокий

стоимость перевозки

стратифицированный

Разделите и выберите группы

высокий

Ошибка определения группы

квота

Заполнение групповых тарифов

средний

Внутригрупповая предвзятость

легко

Не спрашивайте никого, с кем можно связаться

низкий

Серьезная предвзятость выбора

снежный ком

По предложению участника

низкий

Внутрисетевое сходство

Распространенные ошибки

  • Создание выборки без определения вселенной. Репрезентацию невозможно оценить, не зная, на кого вы будете обобщать.
  • Обобщение удобной выборки на всю совокупность. Самая распространенная ошибка; «респондентов опроса» путают со «всеми».
  • Никогда не спрашивайте, кто остался в стороне. Каждый метод кого-то похищает; Ищите это сознательно.
  • Не замечая стереотипа, добавленного ИИ. Модель может добавлять стереотипы, которых нет в данных.
  • Скрытие ограничений. Сокрытие хрупкости образца делает исследование ненадежным и ненадежным.

В заключение

Ценность вывода так же велика, как и репрезентативность выборки, на которой он основан. ИИ; Это мощный помощник в объяснении методов выборки, выявлении недопредставленных лиц, выявлении чрезмерных обобщений и составлении честного раздела об ограничениях. Но остерегайтесь двух предвзятостей: предвзятости самих данных и стереотипов, которые несет ИИ. Четко определите вселенную, спросите, кто не учтен, ограничьте обобщение выборкой и честно запишите ограничения.

Задача приложения

Опишите популяцию и метод выборки для реального или гипотетического исследования. Извлеките, кто может быть недостаточно/перепредставлен из ИИ, с помощью шаблона «выборочной критики» и определите как минимум три источника предвзятости. Затем преобразуйте найденное утверждение в узкое утверждение, которое фактически поддерживается данными, с помощью шаблона «проверка обобщения». Наконец, напишите честный раздел об ограничениях на полстраницы.

контрольный список

  • [ ] Я четко определил вселенную (на которую я буду распространять обобщения).
  • [ ] Я оценил репрезентативность метода выборки.
  • [ ] Я перечислил тех, кого систематически не учитывали.
  • [ ] Я высказал выводы ограниченно и без преувеличений.
  • [ ] Я удалил стереотипы/обобщения, добавленные ИИ.