MatrAIx 实战:用 1290 维人格画像搭建 AI 产品模拟用户

给 AI 产品做评测时,"用户"往往被当成一个没有差别的平均值。MatrAIx 走的是另一条路:把人格画像实例化成 LLM 智能体,在问卷、聊天、网页、原生 App 四种环境里跑可复现的测试任务。这是哈佛/MIT 领衔、200 多位科学家(含 OpenAI、Anthropic、Google DeepMind、xAI 成员)参与的项目,论文在 arXiv(2608.04205),代码 MIT 协议,还放出了 100 万条质控过的人格数据集——今天就能上手。

核心思路:1290 维画像 + DAG 保证自洽

造 83 亿个人格不难,难的是让每个人格内部逻辑自洽。MatrAIx 的做法:

  • 1290 维画像:覆盖背景、心理、能力、行为、生活方式五大类。
  • 条件依赖采样:比如英语能力由"主要语言"和"所在地区"两个父节点联合采样,属性之间是有向无环图(DAG)关系。
  • 兼容性过滤:任何违背常理的组合直接归零,不会出现"肯尼亚农村小学学历 + 哈佛博士 + 只懂冰岛语"的赛博怪物。
  • 真实数据锚定:联合国人口统计、GSS 社会调查、Wikipedia 人物志、Amazon 消费评论、Stack Overflow 开发者调查。

效果:400 次严格对照实验中,智能体符合指定人设的一致率达到 91.5%,人类专家一致性评分 4.135/5。项目已在 25+ 领域部署 1010 个评估任务,累计跑了 18189 次模拟交互。

安装与冒烟测试(无需 API key)

前置要求:Docker、uv + Python 3.12,Node 20+(仅 GUI 需要)。

git clone https://github.com/MatrAIx-ai/MatrAIx-Persona-8B.git && cd MatrAIx-Persona-8B
uv venv --python 3.12
uv pip install -e .
uv pip install -e packages/playground
uv pip install -e packages/harbor-langsmith
uv pip install -e packages/rewardkit

# 冒烟测试,验证整条流水线,不需要任何模型 key:
uv run harbor run -c configs/jobs/example-job-recipe/harbor-smoke-local.yaml

用 CLI 跑第一个任务

# 按你的模型供应商选择 key:
export ANTHROPIC_API_KEY="sk-ant-..."   # anthropic/claude-* 模型
# export OPENAI_API_KEY="sk-..."        # openai/gpt-* 模型

# 生成任务 recipe:固定任务 + 人格 + 模型
uv run python application/scripts/generate_application_job.py \
  --task application/tasks/example-survey_product-feedback \
  --execution-mode auto \
  --persona-ids 0042 \
  --model-name anthropic/claude-sonnet-4-6

# 脚本会打印 recipe 路径,直接执行:
uv run harbor run -c configs/jobs/application-task-job-recipe/example-survey-product-feedback-auto-n1.yaml

--sample-size N 即可批量跑。仓库自带四种参考任务:问卷(产品反馈)、聊天(API 客服机器人)、网页(Playwright 比价)、操作系统应用(computer-use 把笔记转 CSV)。想用图形界面的话,Playground 可在 localhost:5173 选人格群体、挑任务、锁定流水线后一键 Run eval。

实践建议

  • 先从 Survey 任务起步:不用起浏览器/桌面沙盒,最快拿到可验证结果。
  • 直接用现成的 Persona 1Mhuggingface-cli download MatrAIx2026/MatrAIx_Persona_1M_Public_Release --repo-type dataset,不用自己合成。
  • 按群体抽样,别只测单个 persona:价值在于细分人群的差异——价格敏感度、容错度、付费意愿。
  • 每个任务自己写确定性 verifier:用代码校验答案,别让 LLM 自己给自己打分。
  • 记住作者的提醒:这套工具用于假设生成和压力测试,高风险的产品与政策决策仍然要真实用户参与。

资源链接

滚动至顶部