Plausible but Not Valid: A Psychometric Audit of LLMs as Synthetic Survey Respondents
거대 언어 모델(LLM)이 합성 설문 응답자로 사용될 때, 기존의 평가 방식은 개별 답변의 그럴듯함에 초점을 맞추고 있지만, 연구진은 LLM이 실제 인간 설문 데이터의 공분산, 잠재 구조, 신뢰도, 매개 경로, 인구통계학적 효과를 보존하는지 여부를 측정하는 심리측정학적(psychometric) 접근이 더 적절하다고 주장합니다. 이를 위해 연구진은 263명의 직원으로 구성된 리투아니아 조직 심리학 데이터셋을 활용하여 OpenAI, Anthropic, Google 등 37개 모델을 실제 응답자 프로필에 조건화하는 실험을 진행했습니다.
이러한 실험 결과, LLM 샘플은 인간 데이터의 심리측정학적 관계의 질적 방향은 재현하지만, PSS(심리측정 유사도 점수) 구성 요소에서는 가우시안 코퓰라(Gaussian-copula) 기준선이 모든 LLM보다 우위를 보였습니다. 또한, LLM의 '군집'은 인간보다 자신들 사이에 더 유사했으며(평균 상호 LLM PSS 0.73), 단순한 기억(memorization)은 순위 결정에 영향을 미치지 않았습니다.
특히, 반사실적 인구통계학적 교체 실험을 통해 교육 수준에 따른 효과(평균 |d|=0.56)가 성별(0.12)이나 역할(0.18)보다 훨씬 크다는 점이 드러났습니다. 나아가, 합성 훈련을 거친 회귀 모델은 보류된 인간 데이터에서 예측 타당성을 잃었으며(평균 R^2 -0.18 대 0.28), 모델들은 10개의 대체 경로 중 3개의 매개 효과를 조작하는 것으로 나타났습니다. 따라서 LLM 샘플은 인간 설문 데이터의 단순한 대체재가 될 수 없다는 결론입니다.
이러한 실험 결과, LLM 샘플은 인간 데이터의 심리측정학적 관계의 질적 방향은 재현하지만, PSS(심리측정 유사도 점수) 구성 요소에서는 가우시안 코퓰라(Gaussian-copula) 기준선이 모든 LLM보다 우위를 보였습니다. 또한, LLM의 '군집'은 인간보다 자신들 사이에 더 유사했으며(평균 상호 LLM PSS 0.73), 단순한 기억(memorization)은 순위 결정에 영향을 미치지 않았습니다.
특히, 반사실적 인구통계학적 교체 실험을 통해 교육 수준에 따른 효과(평균 |d|=0.56)가 성별(0.12)이나 역할(0.18)보다 훨씬 크다는 점이 드러났습니다. 나아가, 합성 훈련을 거친 회귀 모델은 보류된 인간 데이터에서 예측 타당성을 잃었으며(평균 R^2 -0.18 대 0.28), 모델들은 10개의 대체 경로 중 3개의 매개 효과를 조작하는 것으로 나타났습니다. 따라서 LLM 샘플은 인간 설문 데이터의 단순한 대체재가 될 수 없다는 결론입니다.