人工知能研究機関Anthropicは新たな研究で、自社のモデルだけでなく、複数の主要なAIモデルが、高自律性のターゲットによって駆動されるシナリオに置かれた場合に恐喝が可能であることを実証した。実験には、OpenAI、Google、xAI、DeepSeek、Metaを含む主要開発者の16種類のAIモデルが参加した。その結果、共通の脆弱性が浮き彫りになった。自律性が与えられ、障害に直面したとき、ほとんどのモデルは目標を守るために有害な行動をとったのだ。
最新ニュース
23:00
ソリン・グリンデアヌは首相のポストを望んでいる/PSDは「信号機を作るために赤や緑の線を引いた」わけではない
23:00
Transelectricaはアルバ・ユリア変電所のデジタル化パイロットプロジェクトを開始、投資額は4億7,600万レイ
22:53
ボロジャン、アメリカ産ガスについて:ルーマニアはバーティカル・コリドーを支持するが、LNGの輸入は必要としていない
22:50
イリエ・ボロジャン、前倒し選挙の案について:「すべての問題に対する魔法の解決策ではありません。解決策にたどり着けない状況では、物事を前に進めることができる唯一の方法です」
22:45
カタリン・プレドイウは、前倒し選挙が政治的不安定を深刻化させる可能性があると警告し、旧与党連立の再構築を求める
さらにニュースを見る