VIBE-Bench tests personalized language models under profile-preference conceptual misalignment using personas and dialogues.
unassessed
| Category | reasoning |
|---|---|
| Subcategory | personalized preference reasoning |
| Page status | active |
| Metric | preference-reasoning task accuracy |
| Direction | higher_is_better |
| Unit | % |
| Dataset size | 12239 |
| Publisher | VIBE-Bench authors |
Whether a personalized language model can infer query-relevant preferences when profile cues and preferences occupy different concept spaces.
Personalized dialogue and preference-reasoning tasks using user personas, histories and queries.
No model card in ModelSpec reports this benchmark yet.