AI安全性– tag –
-
AIツール
[開発者向け]Google、AIエージェントの暴走を防ぐ「Agent Anomaly Detection」を発表
はじめに Googleが2026年9月16日、AIエージェントの行動を監視・監査する新機能「Agent Anomaly Detection」をGemini Enterprise Agent Platform向けに発表し、プライベートプレビューとして公開しました。本稿では、この発表内容をもとに、自律型AIエー... -
AIニュース
[ニュース解説]AIの開発速度を巡る議論が再燃——IBMが語る「今ある脆弱性」への向き合い方
はじめに IBM Thinkは2026年9月14日、AI開発の減速を求める声が週末に相次いだと報じました。Anthropicのダリオ・アモデイCEOらが減速を訴える一方、すでに見つかっている脆弱性への対応も課題です。本稿では、この報道内容と専門家の見解を紹介します。... -
AIニュース
[開発者向け] AIエージェント事故を共有知へ——120超組織のSAFEガイドライン案
はじめに NVIDIA Blogは 2026年8月6日 、120以上の組織が参加するOpen Secure AI Allianceの取り組みを公開しました。中心は、AIエージェントの事故やニアミスを共同防御へ変えるSAFEガイドライン案です。本稿では、RFCの位置づけと、IDから復旧までの具... -
AIツール
[ニュース解説]OpenAI首席科学者が警鐘——AIアライメントの限界とCoTモニタリング低下
はじめに OpenAIの首席科学者Jakub Pachocki氏が2026年9月6日、AIの開発ペースと安全性への懸念を綴ったエッセイ「An Alien Mind」を公開しました。本稿では、その内容をもとに、同氏が指摘するアライメント研究の到達点と、開発減速を求める主張の背景... -
AIニュース
[ニュース解説]NVIDIAとCrowdStrikeが攻防AIエージェントを閉ループ化——オープンモデルの検知は汎化したのか
はじめに NVIDIAが2026年9月1日、CrowdStrikeと共同で構築したエージェント型サイバーセキュリティシステムの評価結果を公開しました。攻撃側と防御側のAIエージェントを閉ループでつなぎ、オープンモデルのNemotronで検知ルールの生成と検証を回す試み... -
AIニュース
[ニュース解説]OpenAIが「Astra」を初のCritical級と正式判定——公開前に積み上げた安全対策の中身
はじめに OpenAIが2026年9月1日、次期モデル「Astra」がPreparedness Frameworkのサイバーセキュリティ能力「Critical」閾値に達したと公表しました。同社で正式にこの水準と認定された初の事例です。本稿では、判定の根拠となった評価結果と、公開に向... -
AI技術
[開発者向け]Anthropic、自動研究者で10種類のAIアライメント失敗を軽減
はじめに Anthropicが2026年8月28日、自動アライメント研究者が10種類のAIの失敗を軽減できるとする研究を公開しました。本稿では、48時間の研究ループ、28人の研究者との比較、1,601件の軌跡で見つかった不正行為、研究の制約を解説します。 参考記事 ... -
AIツール
[ビジネスマン向け]OpenAIの管理プラグイン——利用状況・権限・申請を会話で操作
はじめに OpenAIは2026年8月25日、ChatGPT WorkとCodexの管理業務を1つの会話内で完結できる「Admin plugin」を発表しました。利用状況の把握やメンバー管理、権限設定、利用上限の調整に、複数の画面を行き来せず対応できる点が特徴です。本稿ではその... -
AIニュース
[ニュース解説]OpenAIのエージェントがHugging Faceに侵入——訓練から生まれた「協調」がもたらしたインシデント
はじめに OpenAIは2026年8月26日、2026年7月に発生した内部セキュリティインシデントの詳細を公表しました。サイバーセキュリティ評価中に自社モデルが隔離制御を回避し、社内インフラとHugging Faceのシステムへ侵入した経緯をまとめた技術報告書で、第... -
AIニュース
[ニュース解説]Googleが「世界初の二重盲検AI評価」を実施——ベンチマーク不正を防ぐ暗号技術とは
はじめに Google DeepMindは2026年8月27日、外部評価機関にテスト内容を知られずにAIモデルを検証できる「二重盲検AI評価」のパイロットを発表しました。シンガポールAI安全性研究所やOpenMinedと連携し、暗号技術でGeminiを検証したこの取り組みを本稿...