SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization
By Weihan Meng · Paper · cs.CL
Sparse autoencoders (SAEs) are proposed to extract numerous features from large language model (LLM) representations, yet explaining these features still relies primarily on external observation. This reliance leads to superficial explanations inferred from observed model behavio