Agentic AI & Simulation

Core LLM & Training: Architectural Innovations and Efficiency

Core LLM & Training: Architectural Innovations and Efficiency

New: Intern-S2-Mobius decouples knowledge (FFN) from reasoning (self-attn), achieving 4x inference speedup on 35B model and 62.6% data efficiency. ACL paper on attention attractors adds mechanistic detail. IDPAD decoding-time alignment gains +8.58%. New: 'Amplified Does Not Mean Predictive' paper shows Amplification-Lift Gap — models amplify self-correction/uncertainty but not confidence calibration, with implications for PRM and training objectives. Ongoing advances in attention optimization, distillation, and post-training methods.

Sources (2)
Updated Aug 18, 2026