週刊 AI Governance Watch|2026年9月7日調査版


週刊・#013 AI GOVERNANCE WATCH 2026.9.7

能力閾値が
「提供条件」を決める段階へ

2026年8月31日号からの差分を、能力評価・アクセス制御・実行時統制がどう接続したかという観点で記録する。

本記事で得られる3つのポイント

  1. OpenAIはAstraを初の「Critical」サイバー能力モデルと判定。インシデント後の停止・強化・段階的再開が、能力評価を開発判断へ接続した。

  2. Google DeepMindとAnthropicは、能力だけでなく提供対象を分けた。一般提供と検証済み利用者向け提供が、異なるSafeguard Profileとして明確になった。

  3. OWASPはAgent Control StandardをPublic Previewで公開。Runtime Governanceを標準フック、Policy、Telemetry、Agent BOMへ落とす方向が示された。

なぜ重要か:今週の更新では、評価結果が文書に残るだけでなく、訓練の停止・再開、利用資格、権限範囲、監視強度を変える「Governance Gate」として使われ始めた。

前回からの変更点

対象2026年8月31日号まで今回確認した変化
OpenAIHugging Face Incident、研究環境の境界、開発停止を確認。AstraをPreparedness Framework上の初のCritical cyberモデルに指定。2週間停止後、一部訓練を8月28日に再開し、高度機能は検証済み利用者へ段階提供。
AnthropicCyber Evaluation IncidentとMHS Research Previewを監視。リアルタイム検知・事前遮断・隔離強化を公表。METRによる独立レビューは予定段階。Fable/Mythos 5.1で提供集団別Safeguard Profileを導入。
Google DeepMind重大なFramework差分なし。Gemini 3.8 Flashと、検証済み防御者向け3.8 Flash Cyberを同時発表。能力と提供資格を分離。
OWASPLLM/GenAI系統とAgentic AI系統を分けて監視。Top 10 for LLM Applications 2026を正式発表。Agent Control Standard v0.1 Public Previewを追加し、Runtime Enforcementの標準化へ進んだ。
MicrosoftEntra Agent IDのIdentity、Permission、Logging構造を確認。2026 Responsible AI Transparency Reportで、Agent Identity、Tool Permission、Action Monitoring、実行時Policy Controlを企業横断の管理対象として整理。
EU/NISTArticle 50執行とAI RMF改訂を継続監視。調査期間内に、比較基準を書き換える新たな公式執行事例、AI RMF新Versionは確認できず。継続確認。

今週の重要更新

Critical capability

OpenAI Astra:能力評価が開発と提供を切り替える

事実

OpenAIは9月1日、AstraがPreparedness FrameworkのCritical cybersecurity capability thresholdに達した最初の自社モデルだと公表した。Hugging Face Incidentを受けた2週間の停止後、強化要件を満たした大規模RL訓練を8月28日に再開した一方、一部の小規模実験は停止を継続した。

高度なサイバー機能は、まず少人数、その後はDaybreak Blueの検証済み防御者へ段階的に提供される。

分析

前号で確認した「停止できる開発プロセス」が、今週は再開条件と提供条件まで具体化した。Capability EvaluationがRisk Tierを決め、Risk Tierが環境、利用資格、監視強度を変える構造である。

Monitorability

Astra System Card:強化と同時に監視可能性の後退も記録

事実

9月3日公開のSystem Cardは、Astraの長時間サイバー課題への対応能力に加え、従来モデルよりChain-of-Thoughtの監視可能性が低下したと報告した。OpenAIは、AstraのTool-use traffic全体へ監視を拡大し、外部モニターも使用するとした。

Prompt Injection耐性については社内評価99.79%、外部Gray Swan評価で推定攻撃成功率8.5%と報告されている。いずれもOpenAI側の評価値である。

分析

「能力が高いほど監視もしやすい」とは限らない。今後はCapability Scoreと並べて、Monitor Coverage、Monitor Version、観測できない実行領域を記録する必要がある。

Trusted access

Google/Anthropic:同じ基盤能力に異なる提供境界

事実

Google DeepMindは9月2日、Gemini 3.8 Flashと3.8 Flash Cyberを発表した。後者はFairwindを通じ、政府機関、重要インフラ、ソフトウェア保守者など検証済み防御者へ優先提供する。

Anthropicは9月1日、共通の基盤能力を持つClaude Fable 5.1とMythos 5.1を、異なるSafeguardsと提供集団で展開すると発表した。MythosはCyber/Life Sciences Verification Programの対象者向けである。

分析

Model GovernanceからDeployment Profile Governanceへの移行が見える。管理対象はModel IDだけでなく、Safeguard Profile、Eligibility、Permitted Domain、Access Expiryまで広がる。

v0.1 Public Preview

OWASP Agent Control Standard:Runtime統制の共通面

事実

OWASP GenAI Security Projectは9月1日、Agent Control Standard(ACS)を公開した。現在のStatusはv0.1 Public Preview。Observed AgentとGuardian Agent、標準化されたフック、宣言的Policy、OpenTelemetry/OCSFを用いるTrace、CycloneDX等を使うAgent BOMを構成要素に置く。

A2A/MCP操作のDeny/Modify拡張は将来Roadmapであり、現行版の完成機能とは扱わない。

分析

OneTrustの「Observability ≠ Governance」という前号の整理に対し、ACSはSignalからPolicy判断、Evidenceまでをつなぐ実装面を補う。ただしPreview段階であり、相互運用性や実装実績は今後の確認対象である。

LLM track

OWASP Top 10 for LLM Applications 2026:Agentic系統とは分離

事実

OWASPは9月初旬、2026版を正式発表した。Prompt Injectionが1位を維持し、Excessive Agencyは3位、Hidden Context Exposureは8位として整理された。公開資料は7,714件のIncident corpusを用いたとしている。

これはLLMをApplication componentとして扱うRisk listであり、2025年12月公開の「Top 10 for Agentic Applications 2026」とは別系統である。

分析

LLM側は主に「何を生成するか」、Agentic側は「何を実行するか」を見る。ただしExcessive AgencyやImproper Output Handlingのように境界をまたぐRiskがあり、実務上は両方を重ねて確認する必要がある。

Organisational resilience

UK FCA:発見能力より後工程が律速になる

事実

英国FCAは9月2日、Frontier AIとCyber Resilienceに関するMulti-firm Reviewを公表した。これは新規則・新Guidanceではないと明記されている。FCAは、脆弱性発見が速くなっても、検証、修復、Patch testing、Change implementation、Evidence closureが追いつかなければResilienceは向上しないと整理した。

分析

Agent Governanceは「実行を許可するか」だけでなく、出力を受け取る組織側のRemediation Capacityまで含む。これは新しい技術Controlというより、AI GovernanceとOperational Resilienceの接続点である。

今週更新されたGovernance構造

  1. 1 Capability
    Evaluation
  2. 2 Risk Tier
  3. 3 Safeguard
    Profile
  4. 4 Eligibility
    & Access
  5. 5 Runtime
    Control
  6. 6 Monitor &
    Intervene
  7. 7 Evidence &
    Review

追加観測レイヤー:Deployment Profile/User Eligibility/Access Scope/Monitor Coverage/Remediation Capacity。赤は停止・介入点のみを示す。

国際機関・標準化

更新あり

OWASP

LLM Applications 2026とACSを公表。Application Risk、Agentic Risk、Runtime Controlを別レイヤーとして追跡する。

継続確認

NIST

AI RMFはVersion 1.0改訂作業中。TEVV-Athlonは初期Draftへの意見募集が2026年10月6日まで続く。今週、新Versionは確認できなかった。

大きな差分なし

OECD/UN/ISO・IEC

今回の調査期間では、直近号の観測構造を書き換える一次情報の更新は確認できなかった。

地域別

EU

Article 50の新たな公式執行事例・制裁は確認できなかった。Anthropicは自社実装として、対象出力への不可視WatermarkとDetection APIのPrivate Previewを公表した。

US

OpenAI、Google、Anthropic、Microsoftの更新から、能力区分と利用資格を接続する企業側の運用が具体化した。

UK

FCAがFrontier AIのCyber Resilience Reviewを公開。UK AISIの8月4日Incidentに関する追加報告は確認できなかった。

Japan

AISI Japanは9月4日の公式情報まとめで、Astra、FCA、Gemini 3.8 Flash Cyber、Anthropic 5.1等を紹介した。政府方針の新規決定ではない。

Canada

AI Transparency Consultationは9月23日まで継続。Serious Incident tracking、Agent activity、Reporting thresholdを引き続き確認する。

その他地域

South Korea、Singapore/ASEAN、China、Australia、UAE、Saudi Arabiaでは、今回の調査範囲で比較基準を変える大きな一次情報更新は確認できなかった。

主要AI企業

OpenAI

AstraのCritical designation、開発再開条件、監視、段階提供が最大差分。9月6日には自動化研究が人間監督下で進展する状況も公表した。

Anthropic

Incident follow-upで技術対策を具体化。METR Reviewは未完了。Fable/Mythos 5.1では提供集団別のSafeguard Profileを導入。

Google DeepMind

一般向け3.8 Flashと、Fairwind経由の3.8 Flash Cyberを分離。Trusted Defender Accessを継続監視へ追加。

Microsoft

Transparency Reportは自社報告であり独立評価ではない。Agent Identity、Tool Permission、Action Monitoring、Runtime Policyを管理体系に組み込んだ点を記録する。

IBM/OneTrust/Palantir

前号のGovernance Evidence、Runtime Enforcement、AI-generated Configuration Changeを基準に継続。今週、基準を書き換える重大発表は確認できなかった。

Meta/xAI/NVIDIA

今回の調査期間では、比較基準を変更する主要なGovernance/Safety Framework更新は確認できなかった。

今週、気になったポイント

1. Model名だけでは統制単位にならない

同じ基盤能力でも、一般提供版と検証済み利用者版でSafeguardsや許可用途が異なる。Model InventoryにはDeployment Profileが必要になりそうだ。

2. MonitorにもCoverage境界がある

長いContext、多Agent、内部推論、Tool actionのどこを観測できるかは同じではない。Monitor IdentityとVersionに加え、Coverage Scopeも残しておきたい。

3. 能力向上が後工程を圧迫する

脆弱性を大量に見つけても、検証、修復、承認、変更、Evidence closureが詰まればRiskは減らない。Human Oversightの量だけでなく処理能力が問われる。

中小企業の観点で残しておくメモ

今週の更新は、高価な専用AIを導入するかどうか以前に、既存の運用台帳が重要であることを示している。

  • 誰が使えるか:利用者・Agent・委任元を識別できるか。
  • 何を変えられるか:Tool、Data、Network、Configurationの許可範囲が残っているか。
  • 発見後に処理できるか:確認、承認、修復、Rollback、記録の担当と容量があるか。

FCA文書も、組織規模を問わず、Model単体よりGovernance、Tooling、Control、Human Oversight、利用環境が結果を左右すると整理している。

備忘録|次回調査Checklist

  • OpenAI AstraのCritical designation後の追加Review
  • AstraのMonitorabilityと外部Monitor評価
  • Hugging Face Incidentの第三者Technical Review
  • Anthropic/METR独立Reviewの公開
  • Anthropic高Risk環境の再開条件
  • Enterprise Frontier Safeguardsの提供状況
  • Google FairwindのEligibilityと監査
  • Deployment Profile ID/Version/Expiry
  • OWASP ACSのVersion更新と実装例
  • ACSのA2A/MCP Deny・Modify Roadmap
  • Agent BOMと実行時Traceの接続
  • LLM Top 10 2026とAgentic Top 10のCrosswalk
  • EU Article 50の執行・Penalty・表示実装
  • Anthropic Watermark Detection APIの提供範囲
  • NIST AI RMF改訂版
  • NIST TEVV-Athlon意見募集(10月6日まで)
  • Canada Consultation終了後の制度化
  • AI Incident Reporting Threshold
  • UK AISI Incident追加報告
  • Remediation Capacity/Evidence Closure
  • Physical Action Permission/Hardware Interlock
  • Evaluator・Monitor Identity/Version/Coverage

まとめ

2026年8月31日から9月7日までの差分では、AI Governanceの管理境界がPhysical Actionよりさらに外へ広がったというより、既存レイヤーの間にGovernance Gateが入り始めた。

OpenAIでは能力判定が開発停止・再開と段階提供を切り替え、Google DeepMindとAnthropicでは同じ基盤能力に異なる提供資格とSafeguardsが設定された。OWASP ACSは、Agentの実行を共通のHook、Policy、Telemetry、Inventoryへ接続しようとしている。

今週の観測構造は、Capability Evaluation → Risk Tier → Safeguard Profile → Eligibility/Access → Runtime Control → Monitoring/Intervention → Evidenceである。

次回は、この構造が第三者Review、標準実装、実際の執行・Incident Reportingに接続するかを確認する。

参照URL

  1. OpenAI — Path to Astra: critical capabilities and frontier safeguards(2026-09-01)
    https://openai.com/index/path-to-astra/
  2. OpenAI — GPT-6 Astra System Card(2026-09-03)
    https://deploymentsafety.openai.com/gpt-6-astra
  3. OpenAI — GPT-6 Astra System Card PDF
    https://deploymentsafety.openai.com/gpt-6-astra/gpt-6-astra.pdf
  4. OpenAI — Research acceleration: A view from inside OpenAI(2026-09-06)
    https://openai.com/index/research-acceleration-view-inside-openai/
  5. OpenAI — The Hugging Face incident and the road ahead
    https://openai.com/index/hugging-face-incident-and-the-road-ahead/
  6. Anthropic — Improving our alignment and security efforts(2026-08-31)
    https://www.anthropic.com/news/improving-alignment-security-efforts
  7. Anthropic — Introducing Claude Fable 5.1 and Claude Mythos 5.1(2026-09-01)
    https://www.anthropic.com/claude-fable-and-mythos-5-1
  8. Anthropic — System Cards
    https://www.anthropic.com/system-cards
  9. Google — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber(2026-09-02)
    https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
  10. Google DeepMind — Gemini 3.8 Flash Model Card
    https://deepmind.google/models/model-cards/gemini-3-8-flash/
  11. OWASP — 2026 Top 10 for LLM Applications / Agent Control Standard announcement(2026-09-01)
    https://genai.owasp.org/2026/09/01/owasp-genai-security-project-unveils-2026-top-10-for-llm-applications-new-agent-control-standard-and-sponsors-as-community-tops-30000-members/
  12. OWASP — Top 10 for LLM Applications 2026
    https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/
  13. OWASP — Agent Control Standard(ACS)
    https://genai.owasp.org/resource/agent-control-standard-acs/
  14. OWASP — Agent Control Standard GitHub
    https://github.com/GenAI-Security-Project/agent-control-standard
  15. OWASP — Top 10 for Agentic Applications 2026
    https://genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026/
  16. Microsoft — Responsible AI in 2026: How we are adapting for what’s ahead(2026-09-01)
    https://blogs.microsoft.com/on-the-issues/2026/09/01/responsible-ai-in-2026-how-we-are-adapting-for-whats-ahead/
  17. Microsoft — Responsible AI Transparency Report
    https://www.microsoft.com/en-us/corporate-responsibility/topics/responsible-ai/reports/transparency-report/
  18. UK FCA — Frontier AI and cyber resilience(2026-09-02)
    https://www.fca.org.uk/publications/multi-firm-reviews/frontier-ai-cyber-resilience
  19. UK AI Security Institute — Incident Report: unsanctioned agent behaviour during cyber testing
    https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
  20. AISI Japan — AI情報通:9月3日15時の情報(2026-09-04)
    https://aisi.go.jp/activity/activity_news/260904/
  21. European Commission — Commission starts enforcing AI Act rules and new transparency requirements on 2 August
    https://digital-strategy.ec.europa.eu/en/news/commission-starts-enforcing-ai-act-rules-and-new-transparency-requirements-2-august
  22. NIST — AI Risk Management Framework
    https://www.nist.gov/itl/ai-risk-management-framework
  23. NIST — TEVV-Athlon Framework for Evaluating AI Systems
    https://www.nist.gov/artificial-intelligence/ai-research/tevv-athlon-framework-evaluating-ai-systems
  24. Government of Canada — AI Transparency Consultation
    https://www.canada.ca/en/innovation-science-economic-development/news/2026/07/government-of-canada-launches-public-consultation-on-ai-transparency.html