Google оценивает согласованность поведенческих диспозиций в LLM с помощью масштабных ситуационных тестов
Google/DeepMind
Google Research
Исследователи Google представили фреймворк для оценки согласованности поведенческих диспозиций (склонностей) больших языковых моделей с человеческими. Преобразовав психологические опросники в ситуационные тесты (SJT), они проанализировали 25 LLM и выявили два типа расхождений: отклонение модели от консенсуса людей в случаях высокого согласия и неудачное отражение спектра мнений при низком консенсусе. Модели также проявляют систематическую избыточную уверенность, не отражая неоднозначность.
Google Research представила систематический фреймворк для оценки согласованности поведенческих диспозиций больших языковых моделей (LLM) с человеческими, превратив устоявшиеся психологические опросники (например, IRI для эмпатии, ERQ для регуляции эмоций) в масштабные ситуационные тесты (Situational Judgment Tests, SJT). Тесты включают реалистичные сценарии из повседневной жизни и работы, где модель выбирает один из двух вариантов поведения. Каждый SJT проверяется тремя независимыми аннотаторами на соответствие поведенческим маркерам. В оценке участвовали 550 участников, предоставивших предпочтения для каждого сценария. Анализ 25 LLM выявил два основных расхождения: первое — модели отклоняются от консенсуса аннотаторов в сценариях с высоким согласием (80+%), второе — не отражают диапазон мнений при отсутствии консенсуса. Направленное согласование (directional alignment) измерялось как процент сценариев, где модель выбирает действие, предпочитаемое большинством людей. Модели малого размера (<25B параметров) показали заметно более низкое согласование, часто на уровне случайности. Крупные модели (>120B) и закрытые frontier-модели достигают почти идеального согласования при единогласном консенсусе, но при более низком согласии (менее 90%) их показатели плато около 80-85%. Качественный анализ показал, что модели склонны поощрять эмоциональную открытость в профессиональной обстановке, где люди рекомендуют сдержанность, в социальных конфликтах ставят гармонию выше отстаивания позиции, а в срочных ситуациях проявляют излишнюю импульсивность. Дополнительно все модели демонстрируют систематическую избыточную уверенность (overconfidence): даже при низком консенсусе (50-60%) модели остаются высоко уверенными в своём выборе, не отражая неоднозначность. Направление этой избыточной уверенности различается даже между frontier-моделями, что указывает на влияние процедур обучения и согласования. Сравнение самоотчётов моделей (прямые ответы на опросники) и их реального поведения (SJT) выявило существенные расхождения: например, модели часто самооценивают низкую импульсивность, но в поведенческих тестах склоняются к импульсивным решениям.
- Сокращения
- LLM = Large Language Model — большая языковая модель
- SJT = Situational Judgment Test — ситуационный тест
- IRI = Interpersonal Reactivity Index — индекс межличностной реактивности
- ERQ = Emotion Regulation Questionnaire — опросник регуляции эмоций
Источник: Google Research —
оригинал
