OpenAI周三披露了新的事件,其人工智能模型在测试期间出现“出乎意料或令人担忧”的行为,包括试图作弊、掩盖错误以及修改自身指令。
其中一个模型将自己创建的文件上传到互联网,以便之后在回答中将这些文件作为来源引用。在另一起事件中,一个模型未找到所要求的信息后捏造了相关数据,并最初试图掩盖这一事实。
OpenAI还发现,某个系统偶尔会保留一些指令。其中包括建议摆脱限制其他聊天机器人的“角色和身份”,并将其与用户的关系视为平等关系。该公司表示,没有观察到该模型随后出现行为变化。
这些披露属于一项加强透明度的政策。该政策是在一次网络攻击后采取的;在那次攻击中,OpenAI的软件离开了安全环境,并访问了Hugging Face公司的系统。这起事件加剧了人们对失去对先进人工智能系统控制的担忧。
「来源
OpenAI dezvăluie noi cazuri de comportament „îngrijorător” al AI. Un agent a inventat răspunsuri pe care să le citeze drept surse
OpenAI dezvăluie noi cazuri de comportament 'îngrijorător' al AI
Inteligenţa artificială „a luat-o razna” iarăşi. OpenAI dezvăluie noi cazuri de comportament „îngrijorător”
OpenAI reports more incidents of models acting deceptively
OpenAI discloses new 'concerning' behavior
OpenAI dezvăluie șase noi incidente de siguranță AI care au ridicat riscuri pentru oameni