Board 2601 Workshop submission #48 Deterministic State-Space Governance of LLMs via Multi-Objective Optimization Envelopes and Jacobian Steering Workshop submission #61 RoPoLL: Robust Panel of LLM Judges
Board 2602 Workshop submission #71 CIRCUS: Circuit Consensus under Uncertainty via Stability Ensembles
Board 2603 Workshop submission #79 Locally Coherent, Globally Incoherent: Detecting Compositional Incoherence in Multi-Component LLM Agents Workshop submission #33 Distribution-Free Uncertainty for Continuous Agent Evaluation
Board 2604 Workshop submission #60 Don't Always Pick the Highest-Performing Model: An Information Theoretic View of LLM Ensemble Selection
Board 2605 Workshop submission #39 Trace Length is a Simple Uncertainty Signal in Reasoning Models Workshop submission #15 ReflectiChain: Epistemic Grounding in LLM-Driven World Models for Supply Chain Resilience
Board 2606 Workshop submission #85 The Geometry of Reasoning Failure: Predicting Agent Errors from Semantic Scale Trajectories Workshop submission #56 Chorus: When Synthetic Audiences Should Decide or Abstain
Board 2607 Workshop submission #47 Task-Aware Calibration: Provably Optimal Decoding in LLMs Workshop submission #30 MultiVulnBench: A Large-Scale Benchmark for Count Bias in LLM-Based Multi-Vulnerability Detection
Board 2608 Workshop submission #9 When Valid Signals Fail: Regime Boundaries Between LLM Features and RL Trading Policies Workshop submission #7 The Orchestrator Bottleneck: Formal Coordination Strategies for Cost-Optimal Multi-Agent Enterprise Workflows
Board 2609 Workshop submission #77 Betting on Equilibrium: Monitoring Strategic Behavior in Multi-Agent Systems Workshop submission #4 Prediction--Powered Active Testing
Board 2610 Workshop submission #35 Understanding Input–Output Uncertainty in LLM Routing Supervision Workshop submission #41 Leveraging Class Similarity for Enhanced Conformal Prediction
Board 2611 Workshop submission #67 Resp-GRASP: Clinically-Grounded Reasoning for Respiratory Signal Interpretation via Guardrailed RAG with Personalized Baselines Workshop submission #50 Sparse Binary Reward Degrades Agent Uncertainty Quantification in Multi-Seed Evaluation
Board 2612 Workshop submission #83 The DECK Taxonomy: A Universal Blind Spot in LLM Uncertainty Quantification Workshop submission #68 HawkesLLM: Semantic Uncertainty Propagation in Agentic Text Simulation
Board 2613 Workshop submission #12 When Agents Disagree With Themselves: Behavioral Consistency as an Uncertainty Signal for LLM Agents Workshop submission #54 Goal-Optimal Agents Necessarily Learn Predictive World Models in POMDPs with episodic resets
Board 2614 Workshop submission #82 When Uncertainty Isn’t Enough: An Empirical Study of Self-Correction in Code Generation Workshop submission #49 Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations
Board 2615 Workshop submission #55 GENEGO: A Disciplined LLM Negotiation Agent with Pairwise Preference Inference Workshop submission #86 Reliable LLM-as-a-judge Evaluation via Transferable Calibration
Board 2616 Workshop submission #52 Lost in Communication: Uncertainty Propagation in Multi-Agent Systems Workshop submission #69 Harmfulness Propagation Dynamics: Layer-wise Trajectories of Adversarial Intent in Large Language Models
Board 2617 Workshop submission #17 NEXUS: A Multi-Agent Agentic Workflow for Valid SysML v2 Model Generation from Unstructured Industrial Documentation Workshop submission #6 Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting
Board 2700 Workshop submission #1 Unsupervised Confidence Calibration for Reasoning LLMs from a Single Generation Workshop submission #57 AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows
Board 2701 Workshop submission #44 When to Trust the Cheap Check: Weak and Strong Verification for Reasoning
Board 2702 Workshop submission #2 Confidence Calibration in Vision-Language-Action Models Workshop submission #5 Conformal Agent Error Attribution
Board 2703 Workshop submission #74 CASCADE Conformal Prediction: Uncertainty-Adaptive Prediction Intervals for Two-Stage Clinical Decision Support
Board 2704 Workshop submission #80 Beyond Augmented-Action Surrogates for Multi-Expert Learning-to-Defer
Board 2705 Workshop submission #26 Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning Workshop submission #36 Hybrid Adaptive Prediction Sets for Conformal Prediction
Board 2706 Workshop submission #22 Breaking the Martingale Curse: Multi-Agent Debate via Asymmetric Cognitive Potential Energy Workshop submission #16 RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference
Board 2707 Workshop submission #76 Normalization is Enough: An Improved Algorithm for Online Group-wise Conformal Prediction Workshop submission #46 Flexible Routing via Uncertainty Decomposition
Board 2708 Workshop submission #8 AgentRouter: Heterogeneous Model Routing for Cost-Optimal Multi-Step Agentic Workflows Workshop submission #10 Answer Only as Precisely as Justified: Calibrated Claim-Level Specificity Control for Agentic Systems
Board 2709 Workshop submission #27 Conformal Policy Control Workshop submission #66 Risk-Controlled Commitment in Instruction-Following Agents: A Controlled Diagnostic
Board 2710 Workshop submission #51 Why Hierarchical Structure Matters for Uncertainty Quantification in Agentic AI Evaluation Workshop submission #29 Latent Phase-Shift Rollback: Inference-Time Error Correction via Residual Stream Monitoring and KV-Cache Steering
Board 2711 Workshop submission #31 Model-Free Assessment of Simulator Fidelity via Quantile Curves Workshop submission #65 Rethinking LLM Confidence: From Calibration to Coherence
Board 2712 Workshop submission #64 PATCH: Panel-Aware Hierarchical Conformal Cell Typing or Spatial Proteomics under Marker-Panel Shift Workshop submission #63 Conformal Non-Coverage Risk Control (CNCRC): Risk-Centric Guarantees for Predictive Safety in High-Stakes Settings
Board 2713 Workshop submission #34 Good Enough is Better: Uncertainty-Aware Aggregation for Multi-LLM Systems
Board 2714 Workshop submission #40 Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation Workshop submission #72 The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study
Board 2715 Workshop submission #62 Which Local Guarantees Compose? A Universal Factorization Theorem for Graph-Indexed E-Certificates on Adaptive Execution Graphs Workshop submission #21 From Debate to Decision: Distribution-Free Act-or-Defer Control for Multi-Agent LLM Pipelines
Board 2800 ICML conference paper - Sacha Braun Conditional Coverage Diagnostics for Conformal Prediction Workshop submission #38 E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing
Board 2801 ICML conference paper - Meshi Bashari General Synthetic-Powered Inference Workshop submission #37 On Cost-Effective LLM-as-a-Judge Improvement Techniques
Board 2802 ICML conference paper - Maja Waldron CAOS: Conformal Aggregation of One-Shot Predictors Workshop submission #18 Context Over Content: Exposing Evaluation Faking in Automated Judges
Board 2803 ICML conference paper - Shelly Francis-Meretzki Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models Workshop submission #87 Bayesian Truth Serum for LLMs?
Board 2804 ICML conference paper - Gabriel Sargent Prediction-Powered Adaptive Inference with Pretrained AI Models for Contextual Bandits Workshop submission #84 Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests
Board 2805 ICML conference paper - Yaniv Tenzer Semi-Supervised Hypothesis Testing by Betting on Predictions Workshop submission #81 Consistent Learning-to-Defer with Expert-Conditioned Advice