A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models Paper • 2607.12200 • Published 9 days ago • 3
Adversarial Arena: Crowdsourcing Data Generation through Interactive Competition Paper • 2604.17803 • Published Apr 20
SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction Paper • 2606.02540 • Published Jun 1 • 10
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs Paper • 2511.14017 • Published Nov 18, 2025
Not Every Token Needs Forgetting: Selective Unlearning to Limit Change in Utility in Large Language Model Unlearning Paper • 2506.00876 • Published Jun 1, 2025
SemEval-2025 Task 4: Unlearning sensitive content from Large Language Models Paper • 2504.02883 • Published Apr 2, 2025
Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework Paper • 2604.22119 • Published Apr 23 • 6
Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs Paper • 2603.21573 • Published Mar 23 • 1
When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents Paper • 2602.08995 • Published Feb 9 • 2
Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning Paper • 2504.01278 • Published Apr 2, 2025
Simulating and Understanding Deceptive Behaviors in Long-Horizon Interactions Paper • 2510.03999 • Published Oct 5, 2025
D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models Paper • 2509.17938 • Published Sep 22, 2025 • 4
Amazon Nova AI Challenge -- Trusted AI: Advancing secure, AI-assisted software development Paper • 2508.10108 • Published Aug 13, 2025
Customize Multi-modal RAI Guardrails with Precedent-based predictions Paper • 2507.20503 • Published Jul 28, 2025
Evaluating the Critical Risks of Amazon's Nova Premier under the Frontier Model Safety Framework Paper • 2507.06260 • Published Jul 7, 2025 • 6
Establishing Best Practices for Building Rigorous Agentic Benchmarks Paper • 2507.02825 • Published Jul 3, 2025 • 1
The Amazon Nova Family of Models: Technical Report and Model Card Paper • 2506.12103 • Published Mar 17, 2025 • 1
Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation Paper • 2505.21784 • Published May 27, 2025 • 17