论文 Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures
论文 Beyond Attack-Success Rate: Action-Graded Severity Scale for Tool-Using AI Agents
论文 Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems
论文 Automata from Agent Traces: Failure and Next-Step Prediction
论文 PHOENIX: Fine-Tuned SLM-Powered Autonomous Satellite Lifetime Extension via Predictive Self-Healing and Multi-Agent AI Recovery
论文 ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment