LLM EvaluationDiscovering Hierarchical Latent Capabilities of Language Models via Causal Representation LearningPrescriptive Scaling Reveals the Evolution of Language Model CapabilitiesSolving Inequality Proofs with Large Language Models