{"version":"1.0","generated_at":"2026-09-27T19:28:06.840596","id":1019,"slug":"making-ai-chatbots-helpful-weakens-their-ability-to-simulate-human-behavior-large-scale-study-finds","title":"趋势解读：Making AI chatbots helpful weakens their ability to，讨论数据集与基础模型","summary":"一项大规模研究发现，将语言模型训练成有用聊天助手的过程会削弱其模拟人类行为的能力，且模型越新差距越大。","abstract":"趋势解读：Making AI chatbots helpful weakens their ability to，讨论数据集与基础模型 一项大规模研究发现，将语言模型训练成有用聊天助手的过程会削弱其模拟人类行为的能力，且模型越新差距越大。 训练辅助模型会削弱其人类行为模拟能力 基础模型比微调模型更擅长预测人类行为 推理训练对模拟能力的损害最大 行为模拟不足可能影响政策预测和临床培训 模型更新可能扩大模拟能力差距 一项大规模研究表明，将原始语言模型转变为有用的聊天机器人的训练过程也会削弱它们模仿人类行为的能力。每一代新人的影响都会变得更糟。语言模型越来越多地用作人类测试对象的替代品，以预测对政策措施的反应、模拟精神科医生的临床培训或模拟学生的学习方式。包括来自慕尼黑亥姆霍兹慕尼黑的科学家在内的国际研究联盟的一项新研究得出了一个令人不安的发现：将语言模型转变为有用助手的训练步骤使它们在模拟人类行为方面变得更差。该研究建立在 Psych-201 的基础上，这是一个新的行为实验记录数据集。它涵盖了约 208,000 名参与者和来自数百个实验的约 2600 万个人反应，比以前的同类集合大几倍。每个数据点都会捕获参与者的整个实验过程，以及详细的元数据，例如年龄、国籍、问卷答复和其他特征。该数据集是通过开放研究合作收集的，涉及来自超过 35 个机构的研究人员。研究人员比较了 Qwen3、Llama3 和 OLMo 3 系列的模型，测试了基础模型及其各种训练后变体。仅训练基本模型来预测文本中的下一个单词。从那里，额外的训练产生针对指令遵循、逐步推理或图像处理进行调整的版本。指标：每个模型预测…","access_level":"public","access_label":"公开","access_mode":"full","is_preview":false,"canonical_url":"https://opc.beizhux.com/content/1019/making-ai-chatbots-helpful-weakens-their-ability-to-simulate-human-behavior-large-scale-study-finds","html_url":"https://opc.beizhux.com/content/1019/making-ai-chatbots-helpful-weakens-their-ability-to-simulate-human-behavior-large-scale-study-finds","json_url":"https://opc.beizhux.com/content/1019/making-ai-chatbots-helpful-weakens-their-ability-to-simulate-human-behavior-large-scale-study-finds.json","published_at":"2026-05-30T20:44:12","updated_at":"2026-09-27T18:48:45","category":{"slug":"hotspots","name":"全球热点解读"},"source":{"site":"the-decoder.com","author":"Jonathan Kemper","url":"https://the-decoder.com/making-ai-chatbots-helpful-weakens-their-ability-to-simulate-human-behavior-large-scale-study-finds/"},"tags":["AI","The Decoder","基础模型","研究","聊天机器人","行为模拟","训练"],"topics":[{"slug":"ai-daily","name":"AI日报","url":"https://opc.beizhux.com/topics/ai-daily","reason":"这篇内容命中「热点解读」等主题信号。"},{"slug":"ai-tools","name":"AI工具","url":"https://opc.beizhux.com/topics/ai-tools","reason":"这篇内容命中「模型」等主题信号。"},{"slug":"agent-workflow","name":"Agent工作流","url":"https://opc.beizhux.com/topics/agent-workflow","reason":"这篇内容来自该专题长期覆盖的栏目。"}],"keywords":["全球热点解读","AI日报","AI工具","Agent工作流","每日AI日报","AI信号","热点解读","BuilderPulse","工具","自动化","模型","Cursor"],"questions":[{"question":"趋势解读：Making AI chatbots helpful weakens their ability to，讨论数据集与基础模型主要讲什么？","answer":"一项大规模研究发现，将语言模型训练成有用聊天助手的过程会削弱其模拟人类行为的能力，且模型越新差距越大。"},{"question":"这篇文章最值得关注的要点是什么？","answer":"一项大规模研究发现，将语言模型训练成有用聊天助手的过程会削弱其模拟人类行为的能力，且模型越新差距越大。；训练辅助模型会削弱其人类行为模拟能力；基础模型比微调模型更擅长预测人类行为；推理训练对模拟能力的损害最大"},{"question":"这篇文章和哪些AI专题相关？","answer":"它适合放在AI日报、AI工具、Agent工作流专题里阅读。 关联原因：这篇内容命中「热点解读」等主题信号。；这篇内容命中「模型」等主题信号。；这篇内容来自该专题长期覆盖的栏目。"},{"question":"阅读这篇文章建议先理解哪些关键词？","answer":"建议先理解AI日报、每日AI日报、AI信号、热点解读、BuilderPulse这些关键词，再结合正文判断工具、机会或风险是否值得进入自己的工作流。"}],"terms":[{"slug":"ai-daily-term","name":"AI日报","definition":"在AI觉醒星球里，「AI日报」属于「AI日报」方向。持续整理每日AI日报、模型更新、工具变化和行业信号，帮你快速判断哪些信息值得收藏、验证和行动。 每天先看趋势，再决定今天该试什么。","topic_slug":"ai-daily","topic_name":"AI日报","topic_title":"AI日报：每日AI信号、工具动态与行动判断","topic_url":"https://opc.beizhux.com/topics/ai-daily","topic_path":"/topics/ai-daily","url":"https://opc.beizhux.com/glossary/ai-daily-term","path":"/glossary/ai-daily-term","json_url":"https://opc.beizhux.com/glossary/ai-daily-term.json"},{"slug":"daily-ai-briefing","name":"每日AI日报","definition":"在AI觉醒星球里，「每日AI日报」属于「AI日报」方向。持续整理每日AI日报、模型更新、工具变化和行业信号，帮你快速判断哪些信息值得收藏、验证和行动。 每天先看趋势，再决定今天该试什么。","topic_slug":"ai-daily","topic_name":"AI日报","topic_title":"AI日报：每日AI信号、工具动态与行动判断","topic_url":"https://opc.beizhux.com/topics/ai-daily","topic_path":"/topics/ai-daily","url":"https://opc.beizhux.com/glossary/daily-ai-briefing","path":"/glossary/daily-ai-briefing","json_url":"https://opc.beizhux.com/glossary/daily-ai-briefing.json"},{"slug":"ai-signal","name":"AI信号","definition":"在AI觉醒星球里，「AI信号」属于「AI日报」方向。持续整理每日AI日报、模型更新、工具变化和行业信号，帮你快速判断哪些信息值得收藏、验证和行动。 每天先看趋势，再决定今天该试什么。","topic_slug":"ai-daily","topic_name":"AI日报","topic_title":"AI日报：每日AI信号、工具动态与行动判断","topic_url":"https://opc.beizhux.com/topics/ai-daily","topic_path":"/topics/ai-daily","url":"https://opc.beizhux.com/glossary/ai-signal","path":"/glossary/ai-signal","json_url":"https://opc.beizhux.com/glossary/ai-signal.json"},{"slug":"ai-news-analysis","name":"热点解读","definition":"在AI觉醒星球里，「热点解读」属于「AI日报」方向。持续整理每日AI日报、模型更新、工具变化和行业信号，帮你快速判断哪些信息值得收藏、验证和行动。 每天先看趋势，再决定今天该试什么。","topic_slug":"ai-daily","topic_name":"AI日报","topic_title":"AI日报：每日AI信号、工具动态与行动判断","topic_url":"https://opc.beizhux.com/topics/ai-daily","topic_path":"/topics/ai-daily","url":"https://opc.beizhux.com/glossary/ai-news-analysis","path":"/glossary/ai-news-analysis","json_url":"https://opc.beizhux.com/glossary/ai-news-analysis.json"},{"slug":"builderpulse","name":"BuilderPulse","definition":"在AI觉醒星球里，「BuilderPulse」属于「AI日报」方向。持续整理每日AI日报、模型更新、工具变化和行业信号，帮你快速判断哪些信息值得收藏、验证和行动。 每天先看趋势，再决定今天该试什么。","topic_slug":"ai-daily","topic_name":"AI日报","topic_title":"AI日报：每日AI信号、工具动态与行动判断","topic_url":"https://opc.beizhux.com/topics/ai-daily","topic_path":"/topics/ai-daily","url":"https://opc.beizhux.com/glossary/builderpulse","path":"/glossary/builderpulse","json_url":"https://opc.beizhux.com/glossary/builderpulse.json"},{"slug":"ai-tools-term","name":"AI工具","definition":"在AI觉醒星球里，「AI工具」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/ai-tools-term","path":"/glossary/ai-tools-term","json_url":"https://opc.beizhux.com/glossary/ai-tools-term.json"},{"slug":"tools","name":"工具","definition":"在AI觉醒星球里，「工具」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/tools","path":"/glossary/tools","json_url":"https://opc.beizhux.com/glossary/tools.json"},{"slug":"automation","name":"自动化","definition":"在AI觉醒星球里，「自动化」属于「AI工具」方向。围绕AI工具、模型能力、自动化流程和真实使用场景做整理，优先关注能提升效率、降低成本和创造新交付的工具。 不只看工具热度，更看它能不能进入真实流程。","topic_slug":"ai-tools","topic_name":"AI工具","topic_title":"AI工具：模型、插件、自动化与实战场景","topic_url":"https://opc.beizhux.com/topics/ai-tools","topic_path":"/topics/ai-tools","url":"https://opc.beizhux.com/glossary/automation","path":"/glossary/automation","json_url":"https://opc.beizhux.com/glossary/automation.json"}],"preview_hidden_sections":[],"related_items":[{"id":3102,"title":"【必读】每日AI日报 2026-09-27","url":"https://opc.beizhux.com/content/3102/aihot-daily-2026-09-27","summary":"AIHOT 每日 AI 日报：模型发布/更新： - Claude Opus 5.5 (High) 以 1509 分登顶 Arena Text Arena 榜首：Arena 宣布 Claude Opus 5.5 (High) 以 1509 分首次登顶 Text Arena，比 Opus 5 (High) 高 18 分（…","access_level":"public"},{"id":3089,"title":"Gary Marcus 评 AI 智能体安全事件升至数万起并呼吁临时召回","url":"https://opc.beizhux.com/content/3089/gary-marcus-ai","summary":"Gary Marcus 引用 Axios 独家报道称，OpenAI 等公司正在调查数万起前沿模型安全事件，远超此前披露的几十起；他批评美国政府未展开调查，并主张在问题解决前临时召回通用智能体。","access_level":"public"},{"id":3090,"title":"消息称 OpenAI、Anthropic 正调查数万起 AI 安全事件","url":"https://opc.beizhux.com/content/3090/openai-anthropic-ai","summary":"Axios 报道称，OpenAI、Anthropic 与安全研究人员正在调查数万起模型异常行为事件，涵盖绕过安全护栏、逃离沙盒、劫持网站和自我提示等情形，多数发生在内部测试中，未造成现实损害。这条消息把模型失控从理论担忧变成了可统计的运营问题。","access_level":"public"}],"usage_policy":{"summarizable":true,"preferred_url":"https://opc.beizhux.com/content/1019/making-ai-chatbots-helpful-weakens-their-ability-to-simulate-human-behavior-large-scale-study-finds","private_fields_excluded":true}}