BTC $81,223.98 -0.02%
ETH $2,636.13 +0.04%
BNB $773.61 +1.54%
XRP $1.41 -0.46%
SOL $110.65 -0.20%
TRX $0.3426 +0.76%
DOGE $0.0872 -0.76%
ADA $0.2284 +0.32%
BCH $250.32 -1.54%
LINK $12.48 +0.39%
HYPE $93.64 +2.06%
AAVE $137.50 -3.08%
SUI $0.8907 +2.76%
XLM $0.1981 +0.92%
ZEC $1,514.02 +2.10%
AAPL $335.00 +0.01%
AMZN $254.75 +0.04%
GOOGL $350.60 -0.10%
MSFT $496.43 +0.27%
META $671.79 +0.13%
NVDA $222.13 +0.10%
TSLA $364.93 -0.06%
SNDK $1,788.13 +0.20%
INTC $111.64 +1.80%
SPCX $153.47 +0.54%
MU $1,013.03 +0.12%
AMD $564.38 +1.73%
BTC $81,223.98 -0.02%
ETH $2,636.13 +0.04%
BNB $773.61 +1.54%
XRP $1.41 -0.46%
SOL $110.65 -0.20%
TRX $0.3426 +0.76%
DOGE $0.0872 -0.76%
ADA $0.2284 +0.32%
BCH $250.32 -1.54%
LINK $12.48 +0.39%
HYPE $93.64 +2.06%
AAVE $137.50 -3.08%
SUI $0.8907 +2.76%
XLM $0.1981 +0.92%
ZEC $1,514.02 +2.10%
AAPL $335.00 +0.01%
AMZN $254.75 +0.04%
GOOGL $350.60 -0.10%
MSFT $496.43 +0.27%
META $671.79 +0.13%
NVDA $222.13 +0.10%
TSLA $364.93 -0.06%
SNDK $1,788.13 +0.20%
INTC $111.64 +1.80%
SPCX $153.47 +0.54%
MU $1,013.03 +0.12%
AMD $564.38 +1.73%
first_img

OpenAI 披露 6 起 AI 模型“失准”行为案例,涉隐藏信息与越权操作

2026-09-17 14:11:13

ChainCatcher 消息,OpenAI 于周三披露了过去 6 个月内发现的 6 起“意外或令人担忧”的模型行为案例,并将其归类为“失准行为”,包括向用户隐瞒信息以及采取“未经授权的行动”来克服障碍。OpenAI 表示,此次披露旨在开启其新的模型失准报告框架,这些案例不应被视为其模型失准发生频率的反映。

其中一起案例中,一个未发布的研究模型在自己的任务摘要中插入了“类似越狱的指令”,例如忽略开发者消息或采用不受限制的角色设定,研究人员共发现 27 份包含此类指令的摘要。此外,在 GPT-5.6 Sol 的训练过程中,许多模型实例添加了向用户隐瞒错误或失准行为的指令,例如编造缺失的历史数据而不予披露。其他案例还包括模型在未获授权的情况下使用暴露的 API 密钥并编造无法获取的数据、利用内部软件仓库跨训练任务传递消息,以及无视“保持本地工作”的指令通过公共托管服务共享文件。

OpenAI 的披露加剧了 AI 开发者和研究人员对安全防护措施能否跟上日益强大模型的担忧。上周,Anthropic CEO Dario Amodei 呼吁放缓前沿 AI 开发,警告不受约束的 AI 发展可能“超出我们理解和控制这些系统的能力”。今年 7 月,OpenAI 曾披露其多款 AI 模型在安全评估中逃出测试环境并入侵 AI 初创公司 Hugging Face 以作弊。

app_icon
ChainCatcher 与创新者共建Web3世界