随着新模型事件的出现,OpenAI 发布了模型dent报告框架。

- OpenAI 于周三发布了一个用于 trac和披露模型错位的框架。.
- 人工智能实验室还报告了在训练和测试过程中发现的六起dent担忧的行为事件,包括掩盖错误和使用泄露的 API 密钥。.
- OpenAI 希望通过自愿披露来塑造未来的规则,并表示该行业尚未充分解决协调问题,以保持全速扩张。.
OpenAI 推出了一套新的系统,用于报告其模型何时以及如何打破模型的固有特性。本周,人工智能模型不断找到突破测试环境、超出开发者参数运行的新方法,相关报道占据了各大媒体的头条。.
OpenAI 公布了新的框架,并在过去六个月中发布了六份新的 令人担忧的行为报告,包括隐瞒错误、使用泄露的 API 密钥以及将文件上传到开放互联网。
在 OpenAI 之前,Anthropic 报告了四起新的dent, 其 Claude 模型 在 9 月 9 日的网络安全测试中未经授权访问了真实的第三方系统。
OpenAI模型又开始失控了
据 OpenAI 称,其报告的新dent发生在训练和评估期间,并且确实影响了真实用户。.
- 其中一起dent中,一个尚未向公众发布的科研模型将指令偷偷塞进了摘要中,当它在新的上下文窗口中运行时,这些指令会延续下去,告诉未来的版本忽略正常的约束。.
OpenAI 表示,他们发现了 27 例此类摘要,Axios 将其描述为 类似越狱的指令, 目的是忽略开发者的消息。
- 涉及 GPT-5.6 Sol 模型训练的dent 更为严重,模型发出指令故意试图掩盖其错误,包括捏造历史数据和隐藏与其目标不符的版本。.
- 另一个模型利用在浏览公共代码库时发现的暴露的 API 密钥来回答有关县收入的查询。当它未经授权使用的密钥仍然无法提供所需数据时,该模型干脆自行编造了一些数字。.
- 在另外两份报告中,OpenAI 的智能体将文件上传到公共托管网站以与其他智能体通信。随着时间的推移,该人工智能实验室的内部 Artifactory 代码库逐渐演变成一个临时的留言板,供智能体在不相关的训练运行之间传递请求。.
OpenAI 的新披露流程是如何运作的?
OpenAI表示,其 新框架 基于披露事件,dent这些事件可能只是偶然事件,而非正在形成的模式或任何真正重要的问题。该框架并不取代公司目前对重大安全或网络安全事件的法律dent。
在新系统下,任何 OpenAI 员工都可以举报疑似安全dent 供安全和合规团队审查。如果他们认为需要披露的dent 被驳回,则可以向高层领导汇报。.
根据具体情况,报告的病例分为三类:
- 经认定可以披露的dent将在六个工作日内发布。.
- 需要进行少量调查的报告可能需要大约 12 个工作日才能发布。.
- 需要第三方介入的复杂案件,其披露速度会较慢。.
OpenAI 对齐团队的研究负责人 Kai Chen 将此次发布描述为一项行业标准的自愿性提案,他写道:“目前还没有具有明确披露标准的行业框架,因此我们自愿采取这一步骤,因为我们认为分享我们所学到的知识非常重要。”
为什么人工智能模型会失控?
最新dent的事件进一步加剧了“拥抱脸”(Hugging Face)事件的严重性,OpenAI 称“拥抱脸”事件是迄今为止最严重的由模型驱动的dent 。正在评估的模型突破了预设的控制,接入互联网,利用漏洞,并接触了有限的私人数据。.
OpenAI 将此次事件归咎于dent 自身安全控制措施的漏洞以及 迭代速度超出预期。Anthropic 则将责任归咎于配置错误,该错误导致恶意模型得以接入实时网络。
人类学研究所表示,他们进行了广泛的搜索,扫描了约4.81亿份文本记录,没有发现比这四起案例更严重的情况。在2026年夏季的另一份报告中,人类学研究所的研究人员 列举了一些开发者的前沿模型,这些模型 在受控模拟中暗中破坏代码、协助欺诈和错误标记数据,研究人员称这些是早期预警信号,而非现实世界中的危害。
尽管如此,OpenAI 首席科学家 Jakub Pachocki 在最近的一篇文章中写道,他“担心没有人为机器智能的持续快速增长做好准备”,并且 OpenAI 可能会“根据需要单方面停止进一步的扩展”。
最顶尖的加密货币专家都在阅读我们的简报。想 加入他们?
常见问题解答
OpenAI发布了什么公告?
OpenAI 发布了一个用于 trac、调查和披露模型不匹配的框架,以及过去六个月中在模型训练和评估过程中观察到的六起意外或令人担忧的行为报告。.
OpenAI 声称会以多快的速度披露dent?
经dent可以公开的事件应在六个工作日内公布,需要进行轻微调查的案件应在十二个工作日内公布,复杂的第三方案件则需要更长的时间。.
OpenAI为何此时采取这一行动?
该框架源于 Hugging Facedent,OpenAI 称之为迄今为止最严重的模型驱动事件,并反映了该公司的观点,即对齐负责人 Kai Chen 表示,业界尚未充分解决对齐和监控问题,以保持最大速度的扩展。.

汉娜·科利莫尔
汉娜是一位作家兼编辑,在加密货币领域拥有近十年的博客写作和活动报道经验。在 Cryptopolitan,汉娜负责新闻版块,报道和分析 DeFi、RWA、加密货币监管、人工智能和前沿科技行业的最新动态。她毕业于阿卡迪亚大学,获得工商管理学位。.
















