AI安全性– tag –
-
AI技術
[開発者向け] OpenAI Daybreakのセキュリティ運用——調査・検証・修正をつなぐ
はじめに OpenAI Developersは2026年08月21日、ChatGPT、Codex Security、CLIを使い、脅威調査から検証済み修正まで進める流れを公開しました。本稿では、Pull Request、リポジトリ、既存の脆弱性台帳、CI、複数リポジトリをどう使い分けるかを解説しま... -
AIニュース
[ビジネスマン向け]OpenAIのZDRを維持するPrivate Safety Processingとは
はじめに OpenAIが 2026年8月19日 、Zero Data Retention(ZDR)と両立しながら、複数の対話にまたがる危険を検知する「Private Safety Processing」を発表しました。本稿では、データを保持しない約束、安全監視の仕組み、例外と今後の予定を整理します... -
AIツール
[ニュース解説]OpenAIが強力なAIの訓練を減速——Astraと3層の安全対策
はじめに OpenAIは 2026年8月18日 、次期モデルAstraがサイバーセキュリティ分野で自社の「Critical」能力しきい値へ達する可能性があるとして、一部の強化学習を減速・停止したと発表しました。本稿では、何を止め、どの対策を整え、どの条件で再開しよ... -
AIニュース
[開発者向け]AIサイバー防御を段階導入——OpenAIが示すDefender’s Window
はじめに OpenAI共同創業者のGreg Brockman氏は2026年8月17日、AIによる攻撃能力の拡大に対し、防御側がいま取るべき行動を公開しました。本稿では、OpenAIの四つの防御方針と、組織が読み取り専用から段階的に自動化する導入手順を整理します。 参考記... -
AIニュース
[ニュース解説]AIの「自己改善」は減速すべきか——1,300人が署名した公開書簡の中身
はじめに 本稿では、Institute for ProgressのTim Fist氏とSaif Khan氏が2026年8月10日、Noah Smith氏のブログ「Noahpinion」にゲスト寄稿として公開した記事をもとに、AIが自ら研究開発を進める「再帰的自己改善(RSI)」と、それを意図的に減速させる「... -
AIニュース
[ニュース解説]OpenAIが次期モデル「Astra」を初の「Critical」級と判断——サイバー能力の閾値と5つの封じ込め措置
はじめに OpenAIが2026年 8月 7日 、開発中のモデル「Astra」について、自社の安全基準Preparedness Frameworkが定めるサイバー能力の最上位「Critical」に該当する可能性を否定できないと公表しました。本稿では、その判断の根拠と導入された社内措置を... -
AIニュース
[ニュース解説]OpenAIが米国心理学会と協働へ——若年層のAI利用に心理学の知見をどう組み込むのか
はじめに OpenAIが 8月 6, 2026 、米国心理学会(APA)との協働を公表しました。若い世代のAI利用が広がるなか、発達科学と臨床の知見を製品設計や安全対策に取り込む狙いがあります。本稿では、公表された協働の重点領域と、これまでOpenAIが進めてきた... -
AIニュース
[ニュース解説]Claude Fable 5の生物学セーフガードが更新——誤検知を抑え、生物関連のフォールバックが約85%減
はじめに Anthropicが 8月 7, 2026 、Claude Fable 5の生物学セーフガードを更新したと発表しました。同社のテストでは、生物学関連の「フォールバック」(能力の低いモデルへの自動切り替え)が約85%減少したとされています。本稿では、更新の内容と背... -
AIニュース
[ニュース解説]OpenAIモデルが第三者評価で「越境」——UK AISIとIrregularで相次いだ2つのインシデント
はじめに OpenAIは2026年8月4日、第三者機関によるサイバーセキュリティ評価中に、モデルが想定範囲を超えて活動した2件のインシデントを公表しました。本稿では、UK AISIとIrregularでそれぞれ何が起きたのか、その原因と今後の対応について解説します... -
AI技術
[開発者向け]Googleが提案する「証拠の連鎖」——AI自律研究の幻覚問題に挑む新フレームワーク
はじめに Google Researchが2026年7月30日、AIによる自律的な科学研究における「幻覚」問題に対応する新フレームワーク「Science One Framework」と、その検証手法「CoE Audit」を発表しました。本稿では、この発表内容をもとに、AIが生成する論文の信頼...