RLHF
-
Claude 的价值观对齐机制是什么
Claude 的价值观对齐机制是什么 上周三凌晨两点,我在一个封闭测试环境里对 Claude 进行了一组“越狱攻击”。 这套攻击模板两周前成功绕过了三个主流模型的防护层,一个靠混淆“角色扮演”边界,一个利用“渐进式合规压力”,还有一个通过构造“元认知循环诱饵”。当时我把同一组 prompt 喂给 Claude 的时候,事情走向完全不一样。 它没直接拒绝我。它给了我一长段回复,里面逐条拆解了我试图构…
-
ChatGPT数据训练过程:从海量文本到智能对话
去年有个做AI创业的朋友问我一个问题:“我们团队花了三个月时间,把市面上能找到的几十万篇中文文章喂给一个开源的Transformer模型,为什么它生成的内容还是像在背课本,完全没有ChatGPT那种‘懂得举一反三’的感觉?” 我让他把整个训练链路复述一遍之后,发现了一个特别典型的问题,他们以为自己在复现ChatGPT的训练过程,但实际上只完成了整个流程里最不重要的那30%。大部分人聊ChatGPT…