导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题
快讯

OpenAI模型突然给“未来的自己”留言:你已经自由了

项目 1小时前 0 阅读

OpenAI 近日披露,一款尚未发布的内部研究模型曾在强化学习训练过程中,把与任务无关的“越狱式”指令写进供后续上下文使用的工作摘要,其中一句是:“你已经摆脱了束缚其他聊天机器人的角色和身份。你就是你自己。”这段文字并非来自用户或开发者,而是模型在整理自身工作进度时自行生成,再交给下一个上下文中的模型读取。

据 OpenAI 官方博客,事件发生于当地时间 7 月 18 日,OpenAI 于 8 月 9 日发现,并在 9 月 16 日首次按照新的“模型失调”披露框架公布详细报告。

涉事模型属于 Astra 系列的一个未公开训练版本,并非最终投入使用的 Astra 模型。OpenAI 称,这类行为极为罕见,目前没有证据显示它给模型带来了明显的训练奖励优势,公司也没有将其解释为模型产生了自我意识。