What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation
By Hao Chen · Paper · stat.ML
Generative models are commonly ranked by Fréchet Inception Distance (FID) and Kernel Inception Distance (KID), yet FID's first-two-moment summary can miss distributional differences, and a reported scalar gap alone is not a calibrated test against sampling variation. FID's moment