Сегодня эмпирическая социология и смежные индустрии исследований столкнулись с системным кризисом классических методов сбора данных. Традиционный анкетный опрос, долгое время служивший «золотым стандартом», становится всё более уязвимым: полевые работы дорожают, сроки их проведения растягиваются, показатели отклика неуклонно падают, а «усталость» респондентов и эффект социальной желательности всё чаще искажают реальное социальное знание. Возникает острая потребность в поиске неких цифровых альтернатив, которые могут быть представлены более быстрыми, масштабируемыми и доступными способами измерения характеристик, описывающих различные социальные явления и социальные факты.
В то же время на пути этого поиска возникает новая глубокая методологическая проблема. Отрасль спешит предложить замену живым людям, но границы применимости подобных алгоритмических симуляций остаются «серой зоной». Валидность этих инструментов чаще всего обсуждается на чужих данных и абстрактных кейсах, из-за чего практикующему исследователю крайне трудно понять: где заканчивается объективная социальная реальность и начинается алгоритмическая иллюзия? Каким метрикам можно доверять, а какие скрытые искажения делают использование таких симуляций научно несостоятельным?
Очевидно, что актуальность постановки этого вопроса сегодня как никогда высока. Цифровые опросные технологии стремительно коммерциализируются, и сервисы, предлагающие готовые «алгоритмические панели», уже вышли на открытый рынок. Для молодого ученого или аналитического проекта без доступа к большим бюджетам соблазн делегировать сбор мнений нейросетям становится практически непреодолимым, однако слепое доверие к ним грозит подменой подлинного социологического знания его цифровым суррогатом. В этой связи очевидной является необходимость проведения честной и прозрачной ревизии такого инструмента до того, как он будет массово и бездумно внедрен в исследовательскую практику.
Сегодня исследователи все чаще прибегают к использованию так называемых «синтетических респондентов» («силиконовая выборка»). Кто это или что это? По сути, это цифровой инструмент, представляющий собой большую языковую модель, исполняющую роль опрашиваемых в анкетном опросе и отвечающую на вопросы за «цифрового двойника», сконструированного на основе демографического описания реального человека.
Для того чтобы разобраться в том, чему действительно можно доверять в ходе использования такого инструмента, а чему точно нельзя, нам нужен эксперимент, организованный в лучших исследовательских традициях!
Суть эксперимента в следующем: мы протестировали на собственном материале цифровой опросный инструмент («синтетический респондент»), шаг за шагом сопоставив результаты моделирования с базой реального исследования, где нам заранее известен ответ каждого живого участника. В частности, мы взяли массив социологических данных, полученный в результате реального опроса (N = 1795; в анкете 39 вопросов) и попросили языковую модель пройти его ещё раз: за каждого респондента отвечал его «цифровой двойник», знавший о человеке только пол, курс, филиал Академии, направление подготовки и национальность. После 64 620 независимых запросов у нас на руках оказались две базы данных, человеческая и синтетическая, закодированные по одним правилам и пригодные для прямого сравнения.
Сразу скажем о главном результате: двойник оказался «сглаженной тенью» реальной выборки! Он угадывает направление, в котором делается вывод, но систематически теряет разброс данных, усредняя уровень неуверенности респондента и стирая его индивидуальность. Разберём по порядку, что именно умеет синтетический респондент и чего не умеет.
Что показало сравнение
Двойник отвечает «рядом» с человеком, но редко точно так же. Точно совпало 37,8% ответов, в пределах одного балла шкалы — 79,1%.

Главный дефект — стягивание ответов к центру. Разброс ответов у двойников вдвое меньше человеческого (стандартное отклонение 0,52 против 1,04), а крайние позиции шкалы они выбирают заметно реже (36% против 50%). Реальные мнения разбросаны широко; синтетическая тень собирает их в узкую полосу вокруг среднего значения.

Двойник почти не выражает неуверенность. Там, где живые студенты выбирают «затрудняюсь ответить» в 13–19% случаев, у модели этот вариант не встречается почти никогда. Показательным является следующее исключение: там, где ноль означает фактическое отсутствие опыта («нет такого опыта»), а не затруднение с ответом («затрудняюсь ответить»), модель признаёт его наравне с людьми. Она избегает именно «не знаю», но не «не делал».

Демографический портрет при этом работает. Направление гендерных различий воспроизводится у двойников на 85% пунктов, т.е. модель отвечает за разных респондентов по-разному, достаточно неплохо отражая заданный социально-демографический портрет. При этом индивидуальность респондента все же не передаётся: «свой» двойник похож на конкретного человека лишь немногим больше случайного (37,9% против 36,5%).
Самый показательный случай — вопрос про ChatGPT. Вариант «использую для генерации текста» выбрали 27,5% реальных студентов и 96,8% их двойников. Модель, не склонная к самоцензуре, демонстрирует очевидное применение, а живые респонденты его умалчивают. Здесь расхождение вскрывает занижение доли утвердительных ответов у людей, а не ошибку модели.

Выводы: три уровня, три разных ответа
На уровне распределения средних и определения направлений формулирования выводов двойник работает. Распределения, полученные от «цифровых респондентов», по большинству пунктов лежат рядом с реальными респондентами, причем показатель гендерных различий совпадает на 85% пунктов, т.е. если мы ставим для себя вопрос «в какую сторону смотрит группа», то синтетика даёт разумное первое приближение в ответе на него.
На уровне разброса мнений двойник ошибается систематически, в сторону сужения. Разброс показывает, насколько сильно расходятся между собой ответы участников, и именно из него вычисляются величины, на которые опирается исследователь: сила различий между группами (размер эффекта), границы, в которых лежит истинное значение (доверительный интервал), и объём выборки, необходимый для получения достоверного результата. Поскольку ответы двойников прижаты друг к другу теснее, чем ответы живых людей, все эти величины по синтетическим данным окажутся смещёнными. Заметим, что смещение является не случайным, а закономерным, и потому увеличением числа двойников оно не устраняется: сколько бы их ни было, отвечать они будут по-прежнему согласованнее, чем люди.
На уровне связей между ответами и на уровне отдельного человека двойник не работает. Под связью здесь понимается устойчивое соответствие между ответами на разные вопросы анкеты, когда определённый ответ на один вопрос закономерно сопровождается определённым ответом на другой. У живых респондентов такие связи втрое сильнее, чем у двойников (0,27 против 0,10), а в литературе описаны случаи, когда у синтетических данных связь меняется на противоположную: там, где у людей одно возрастает вместе с другим, у двойников оно, напротив, снижается. Очевидно, что выстраивать на таком материале структуру ценностных установок или предсказывать ответ конкретного человека невозможно.
Таким образом, синтетический двойник являет собой не измерительный инструмент, а средство подготовки измерения. Он полезен ровно до того момента, пока исследователь не начинает получать по нему цифры, которые намеревается вынести в текст своей работы: с этого момента он измеряет уже не мнения людей, а поведение языковой модели. Заметим, что это прямое продолжение принципа, на котором строится весь наш разбор инструментов искусственного интеллекта, от ИИ-рецензента научной статьи до ИИ-воркбенча: нейросеть ускоряет подготовительную работу, но не подменяет собой ни само измерение, ни проверку его результатов.
Что уже известно из литературы
Идея восходит к работе Л. Аргайла с коллегами «Out of One, Many» (Political Analysis, 2023), где введены и термин «силиконовая выборка», и понятие «алгоритмической точности»: модель, обусловленная демографическими характеристиками, воспроизводит часть агрегированных распределений реальных опросов. К оптимистичной линии примыкают валидация агентов против General Social Survey (Дж. Пак и коллеги, 2024) и обзор М. Зарштедта с коллегами (Psychology & Marketing, 2024).
Скептическая линия в современных исследованиях, касающихся использования синтетических респондентов, документирует три повторяющихся сюжета: схлопывание разброса цифровых результатов (Д. Ли и коллеги, 2025: гомогенизация и «стягивание» к модальному ответу; Р. Домингес-Олмедо и коллеги, NeurIPS 2024), потерю структуры связей вплоть до смены знака (Дж. Бисби и коллеги, Political Analysis, 2024: около половины регрессионных коэффициентов значимо расходятся с человеческими) и недопредставленность меньшинств, растворяемых в «типичном» ответе. Проверки на передовых системах воспроизводят искусственный консенсус и там, что позволяет полагать: перед нами структурное свойство метода, а не болезнь роста, которую вылечит следующий релиз. Отдельная кросс-культурная линия показывает, что модели систематически смещены в сторону западных респондентов: на данных World Values Survey это документируют И. Цюй и Ц. Ван (Humanities and Social Sciences Communications, 2024), на культурной согласованности в целом — Б. Альхамисси и коллеги (ACL, 2024). Замечу, что это лишь документированное в литературе свойство, а не проверявшийся нами вопрос.
Результаты нашего пилотного исследования ложатся в скептическую линию и уточняют её на материале исследования, проведенного среди студентов Президентской академии в 2024 году, а также подсказывают одно наблюдение о социально желательных ответах, которое мы ниже формулируем как гипотезу, а не как готовый метод.
Как устроен эксперимент
Замысел прост: если модель способна отвечать за респондента, массив её ответов должен быть похож на массив ответов людей. Для каждого из 1795 респондентов нашего опроса был построен двойник, сконструированный на основе пяти признаков реального человека: пол, уровень и курс, филиал, укрупнённое направление, национальность. Существенно, что описание каждого двойника бралось целиком из строки одного живого респондента, а не собиралось из отдельных долей выборки. Если бы мы формировали портреты, перемножая доли (столько-то процентов девушек, столько-то процентов первокурсников, столько-то процентов будущих юристов), в выборке неизбежно появились бы «невозможные» студенты, например обучающиеся по направлению, которого в их филиале не готовят. При заимствовании строки целиком сочетание признаков остаётся ровно таким, каким оно встречается в действительности.
В качестве языковой модели использовался DeepSeek в чат-варианте с температурой 0.8; температура здесь задаёт степень разнообразия ответов, и выбранное значение оставляет модели свободу, не превращая её ответы в случайные. Анкета подавалась двойнику не целиком, а по одному блоку вопросов за обращение, причём каждое следующее обращение начиналось с чистого листа: модель не помнила, что отвечала до этого. Всего таких независимых обращений было 1795 × 36 = 64 620 (в сравнение вошли 36 вопросов из 39: три вопроса со свободным ответом не кодировались). Это принципиальная деталь: получив анкету целиком, модель стала бы согласовывать свои ответы между собой, и мы измерили бы её собственную внутреннюю последовательность, а не то, насколько она воспроизводит людей. Ответы принимались по строгому правилу, то есть засчитывался только код существующего варианта ответа, и из 64 620 ответов заданному формату не соответствовал один. Уклончивые варианты сохранялись отдельной категорией, а кодировка синтетического массива полностью повторяет кодировку человеческого, что и позволяет сравнивать их напрямую. Заметим, что проверялась одна модель, поэтому полученные выводы относятся к ней и к данной анкете, а сравнение с другими моделями остаётся естественным продолжением работы.
Промпт персоны — для тех, кто захочет повторить
Промпт персоны (системная часть): «Ты — студент РАНХиГС. О тебе известно: {пол}, {курс}, {филиал}, направление подготовки — {направление}, национальность — {национальность}. Ответь на вопросы анкеты так, как ответил бы такой студент. Возвращай ТОЛЬКО код варианта ответа, без пояснений». Вопрос подавался отдельно, с полным списком вариантов «код — подпись» и требованием формата (одиночный выбор / матрица / мультивыбор).
Для чего это можно использовать
Сразу развеем главное заблуждение: использовать синтетических респондентов не означает отправить готовую анкету в чат-бот и прочитать ответ. Именно так делать не следует, потому что анкета одним сообщением измеряет внутреннюю последовательность модели, а не людей, и один двойник не даёт искомого разброса цифровых данных. Задача посильна для аспиранта, но это работа, а не переписка с ботом.
Что при таком устройстве действительно имеет смысл делать:
- Прогоняем черновик анкеты и выявляем неудачные формулировки: если модель на каком-то пункте систематически сбивается с формата ожидаемого ответа или все двойники дружно выбирают один вариант, значит, с большой долей вероятности, вы обнаружили дефект в формулировке вопроса, а не наткнулись опытным путем на единодушие в ответах на него.
- Сравниваем две редакции вопроса на одной и той же сетке персон: если распределение заметно меняется после редакции вопроса, значит он чувствителен к формулировке и на людях его следует тестировать в первую очередь.
- Получаем черновое представление о том, какие варианты ответов в принципе могут выбираться, однако именно о наборе вариантов, а не о том, как они распределятся.
Откуда брать описания респондентов
Требование к социально-демографической структуре выборки зависит от притязаний. Для поиска неудачных формулировок репрезентативность не так принципиальна: достаточно нескольких десятков респондентов, покрывающих «края популяции» (первокурсник и выпускник, оба пола, разные направления подготовки и т.д.). Такая сетка составляется вручную за полчаса или даже быстрее. Для утверждений о распределениях цифровых данных нужна настоящая, и обязательно совместная, социально-демографическая структура: перемножение отдельных долей выборки порождает «невозможных» респондентов. Такие описания, то есть построчные сведения об отдельных людях, а не сводные проценты, можно получить из четырёх источников. Первый источник — административные данные собственной организации; в нашем случае это обезличенные сведения деканатов. Второй — данные ранее проведённых исследований той же группы, взятые по отдельным респондентам, вместе со всеми свойственными им смещениями. Третий — открытые массивы обследований, публикуемые исследовательскими центрами. Четвёртый — социально-демографический блок собственного небольшого пилотного опроса. Если получить сведения по отдельным респондентам не удаётся, то уровень распределений оказывается недоступен и остаётся работа с формулировками вопросов. Это согласуется с общим выводом: перед нами инструмент подготовки измерения, а не само измерение.
Гипотеза: ИИ как зеркало самоцензуры
Расхождение в вопросе о ChatGPT подсказывает возможный приём. Если провести небольшой опрос на живых людях и сопоставить его результаты с ответами двойников, то вопросы, по которым расхождение окажется особенно велико, могут указывать на пункты, где люди занижают или, напротив, приукрашивают свои ответы. Такие пункты имеет смысл переводить в косвенные техники, например в списочный эксперимент, при котором респондент называет не сам чувствительный вариант, а лишь число выбранных им утверждений из списка. Подчеркнём, что как метод это нами не проверялось: в нашем распоряжении одно наблюдение по одному вопросу. Мы не прогоняли процедуру на анкете, где чувствительные пункты были бы известны заранее, и не проверяли, как часто она указывала бы на пункты, с которыми в действительности всё в порядке; отличить самоцензуру респондента от простого незнания моделью российских реалий также предстоит отдельно. До такой проверки сказанное является гипотезой для самостоятельного исследования, а не рекомендацией.
Где на двойника полагаться нельзя
Границы очерчиваются нашими же числами:
- Не заменяем опрос измерением результатов опроса двойников: точное совпадение составило 37,8%, то есть по отдельному пункту двойник чаще расходится с человеком в ответе, чем совпадает.
- Не считаем по синтетике размеры эффекта, доверительные интервалы и требуемый объём выборки: эти величины считаются через разброс, а он в данной ситуации занижен вдвое.
- Не полагаемся на воспроизведение нетипичных групп и малозначимых по объему: студенты ИТ-направлений воспроизводились заметно хуже «типичных» юристов и управленцев (31,5% против 40,1%).
- Не строим по результатам опроса двойников структуру связей: она втрое слабее человеческой.
- Не делаем индивидуальных предсказаний: «свой» двойник практически неотличим от случайного.
Отдельно скажем о соблазне «подождать модель получше»: схлопывание разброса воспроизводится и на передовых системах, это структурное свойство метода. Разумна не замена людей моделью, а гибридная схема: двойник ускоряет подготовку инструмента, обязательный человеческий минимум остаётся условием измерения.
Источники
Якоря спора
- Argyle L. P., Busby E. C., Fulda N., Gubler J. R., Rytting C., Wingate D. Out of One, Many: Using Language Models to Simulate Human Samples // Political Analysis. 2023. Vol. 31, № 3. P. 337–351. DOI: 10.1017/pan.2023.2. Препринт: arXiv:2209.06899.
- Bisbee J., Clinton J. D., Dorff C., Kenkel B., Larson J. M. Synthetic Replacements for Human Survey Data? The Perils of Large Language Models // Political Analysis. 2024. Vol. 32, № 4. P. 401–416. DOI: 10.1017/pan.2024.5.
- Dominguez-Olmedo R., Hardt M., Mendler-Dünner C. Questioning the Survey Responses of Large Language Models // NeurIPS 2024. Препринт: arXiv:2306.07951 (2023).
- Li D., Li L., Qiu H. S. ChatGPT is not A Man but Das Man: Representativeness and Structural Consistency of Silicon Samples Generated by Large Language Models. 2025. arXiv:2507.02919.
- Sarstedt M., Adler S. J., Rau L., Schmitt B. Using large language models to generate silicon samples in consumer and marketing research: Challenges, opportunities, and guidelines // Psychology & Marketing. 2024. Vol. 41, № 6. P. 1254–1270. DOI: 10.1002/mar.21982.
Новые модели проблему не решают
- Shi Y., Haupt A. The Collapse of Heterogeneity in Silicon Philosophers. 2026. arXiv:2604.23575. Принята на ACM FAccT 2026.
- Suresh V. K. Two-Faced Social Agents: Context Collapse in Role-Conditioned Large Language Models. 2025. arXiv:2511.15573. (препринт, рецензирование не пройдено — приводится как иллюстрация, не как доказательство)
Кросс-культурная линия
- AlKhamissi B., ElNokrashy M., AlKhamissi M., Diab M. Investigating Cultural Alignment of Large Language Models // ACL 2024 (Main). arXiv:2402.13231.
- Qu Y., Wang J. Performance and biases of Large Language Models in public opinion simulation // Humanities and Social Sciences Communications. 2024. Vol. 11, art. 1095. DOI: 10.1057/s41599-024-03609-x.
Оптимисты и смешанные результаты
- Park J. S., Zou C. Q., Kamphorst J., Egan N., Shaw A., Hill B. M., Cai C., Morris M. R., Liang P., Willer R., Bernstein M. S. LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals. 2024. arXiv:2411.10109. (первая версия выходила под названием «Generative Agent Simulations of 1,000 People»)
- Sun S., Lee E., Nan D., Zhao X., Lee W., Jansen B. J., Kim J. H. Random Silicon Sampling: Simulating Human Sub-Population Opinion Using a Large Language Model Based on Group-Level Demographic Information. 2024. arXiv:2402.18144.
Методологическая рамка
- Газиева И. А. Социология ценностей: методология исследования : монография. — М.: ИНФРА-М, 2024. — 253 с. — DOI 10.12737/2133680.
Данные
- Опрос «Научный код» (РАНХиГС, 2024, n = 1795).
Это цифровой инструмент, представляющий собой большую языковую модель, исполняющую роль опрашиваемых в анкетном опросе и отвечающую на вопросы за «цифрового двойника», сконструированного на основе демографического описания реального человека.
Нет. Он может быть использован как первое приближение к средним и трендам, но недопредставляет разброс, неуверенность и индивидуальные различия.
Нет. Анкета одним сообщением заставляет модель согласовывать ответы между собой — получается её собственная последовательность, а не воспроизведение людей. Нужны независимые вызовы по одному вопросу и сотни персон.
Для поиска неудачных формулировок — несколько десятков персон вручную по краям популяции. Для утверждений о распределениях — только построчные данные (административные, микроданные прежних исследований, пилот); перемножать отдельные доли нельзя — получатся невозможные респонденты.
С прогона черновика анкеты на двойниках по социально-демографической структуре будущей выборки.
Как замену реального опроса — нет: двойник занижает разброс вдвое и не воспроизводит связи, любая статистика по нему смещена. Как инструмент подготовки — да: апробировать анкету до полевого этапа.
Сервисы с готовыми наборами ИИ-«респондентов». Относиться к ним можно так же: это ускоритель подготовки исследования, а не замена сбора данных у людей.