Core LLM & Training: Architectural Innovations and Efficiency
New: Intern-S2-Mobius decouples knowledge (FFN) from reasoning (self-attn), achieving 4x inference speedup on 35B model and 62.6% data efficiency. ACL paper on attention attractors adds mechanistic detail. IDPAD decoding-time alignment gains +8.58%. New: 'Amplified Does Not Mean Predictive' paper shows Amplification-Lift Gap — models amplify self-correction/uncertainty but not confidence calibration, with implications for PRM and training objectives. Ongoing advances in attention optimization, distillation, and post-training methods.
Sources (2)
Updated Aug 18, 2026