Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features Paper β’ 2602.10437 β’ Published Feb 12 β’ 2
OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment Paper β’ 2607.26981 β’ Published 6 days ago β’ 2
OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment Paper β’ 2607.26981 β’ Published 6 days ago β’ 2
Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects Paper β’ 2607.20596 β’ Published 13 days ago β’ 2
Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features Paper β’ 2602.10437 β’ Published Feb 12 β’ 2
Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects Paper β’ 2607.20596 β’ Published 13 days ago β’ 2
Paused Control Reinforcement Learning π Explore LLM token decisions with featureβdriven visualizations
Running 4 CorrSteer: Correlation-Based Steering of Language Models via Sparse Autoencoders π§ 4 Steer language model output by clicking visual layers