今天要推荐一篇论文:用 83 亿个个性化智能体来模拟真实用户行为,从而对大规模 AI 系统和数字产品进行评估。

A

这篇论文的全称为《MatrAIx:用 83 亿个个性化智能体模拟世界》(arXiv 编号 2608.04205),提交于 2026 年 8 月 4 日,归类于 cs.AI 方向。研究团队规模庞大,主要来自哈佛大学、麻省理工学院等机构,组织者为 Xiaomin Li 和 Yuexing Hao,参与者还覆盖了南加州大学、斯坦福大学、加州大学伯克利分校、伊利诺伊大学厄巴纳-香槟分校等高校,顾问委员会成员包括 Dawn Song、James Zou 等人。

这项研究针对的是一个现实困境:真人测试成本高昂、周期漫长、难以扩大规模,而离线基准测试又完全忽略了用户之间的个体差异。

为此,团队构建了一个包含 83 亿条用户画像的数据库。每条画像涵盖 1290 个维度的分类信息,涉及背景、心理特征、能力水平、行为习惯和生活方式等。这些画像一部分通过依赖图采样生成,以保留属性间的内在关联,另一部分则从真实用户资料中提取。

研究团队公开了经过质量筛选后的 100 万条画像数据,其中约 60 万条基于真实人类信息,40 万条为合成数据,目前已上传至 Hugging Face 平台。

在此基础上,团队搭建了四种可交互的测试环境:问卷、聊天机器人、网页和移动应用。他们将用户画像实例化为大语言模型驱动的智能体,让这些智能体真正去“使用”产品并做出决策。

整个研究共进行了超过 1.8 万次实验。在对照测试中,这些智能体的行为一致率达到了 91.5%。

对于从事智能体产品开发的人来说,这套方法提供了一个新思路。以往获取用户反馈要么依靠真人测试,要么依赖开发者自身的主观判断。现在可以按照真实分布抽取一批虚拟用户,观察不同背景人群在面对价格变化、助手故障或响应延迟时的反应差异。

这套方案同样适用于软件工程领域的任务,可以用来测试编码智能体或各类开发工具在多样化用户画像下的表现。

一个值得注意的发现是,即便使用相同的用户画像和同一项任务,不同底层模型得出的产品结论也可能大相径庭。例如,GPT 和 Claude 对同一个网页的付费意愿评估相差超过 50 个百分点,这说明模型自身的偏好会显著影响模拟结果。

论文也明确指出,这套系统更适合用于前期问题筛查和假设生成阶段。真正要做最终决策时,真人测试仍然是不可或缺的环节。

论文编号为 arXiv 2608.04205,相关数据和交互平台已经开源。这项工作体量庞大,工程实现也相当扎实,值得认真阅读。

评论 (0)

?
0/1

还没有评论,来发第一条吧

网站上的服务均为第三方提供,
请用户注意自行甄别。

北京酷讯互动科技有限公司

备案京ICP备2024094994号-17

© 2026 虾345 · All Rights Reserved

用户服务协议·隐私政策