OraRL: ใช้ Annotations เป็น Oracle Rollouts ลดต้นทุน RL สำหรับ Video MLLMs
OraRL ใช้ annotations เป็น oracle rollouts ผ่าน decoupled advantage estimator เพื่อหลีกเลี่ยง advantage inversion ช่วยลดเวลาเทรนเหลือ 2.2x ของ SFT...

Created by Chaiyphop Nilpat
New AGI architectures, causal reasoning, and early-stage startup insights
Explore the latest content tracked by Cognitive Engineering Frontier
OraRL ใช้ annotations เป็น oracle rollouts ผ่าน decoupled advantage estimator เพื่อหลีกเลี่ยง advantage inversion ช่วยลดเวลาเทรนเหลือ 2.2x ของ SFT...
Apodex 1.1 นำเสนอแนวทาง Scaling Agentic Intelligence สำหรับงานที่ซับซ้อน ควรติดตาม paper เพื่อดูสถาปัตยกรรมใหม่ที่อาจเป็นทางเลือกใน ecosystem AGI
Attention compute เติบโตแบบ quadratic ตามจำนวน turn ใน agentic loops ทำให้ชิปแบบ static inference ล้าสมัย ผู้ผลิตจึงหันมาออกแบบระบบ rack-scale ร่วมกับ CPU ที่เน้น single-thread performance สำหรับ tool calls และ control flow
สถาปัตยกรรม Relational Intelligence Engine เสนอชั้น orchestration แยกการแทนค่า identity, order, boundary, context ออกจาก neural language models...
เทรนด์ Harness Engineering กำลังกลายเป็นหัวใจสำคัญในการทำให้ Agent ทำงานระยะยาวได้น่าเชื่อถือ โดยมีสามวิธีที่แตกต่างกันในการทำให้ harness...
SpaceXAI นำ NVIDIA Vera มาใช้เร่งงาน Agentic AI ด้วย CPU ที่ออกแบบมาเพื่อ orchestration, code execution และ simulation โดยตรง ทำให้ agents...
LLM ที่ฝึกจากลำดับสัญลักษณ์การเดินหมากกระดานล้วน ๆ สามารถสร้าง แผนที่ภายใน และแบบจำลองโลกขึ้นเองได้โดยไม่เคยเห็นกระดานจริง การค้นพบนี้ให้หลักฐานเชิงประจักษ์ชัดเจนว่าสถาปัตยกรรมปัจจุบันมีรากฐาน World Model อยู่แล้ว
ความน่าเชื่อถือกลายเป็นประเด็นหลักแทนความสามารถล้วน ๆ เมื่อ Agent ต้องรับมือ workflow ระยะยาวที่มีสถานะ
แนวโน้มชัดเจนว่าการพัฒนาเอเจนต์กำลังย้ายโฟกัสจากความสามารถของโมเดลเดี่ยวไปสู่ ระบบที่ไว้ใจได้ ผ่าน 3 กลไกหลัก
Flex-π พบผลลัพธ์ที่น่าประหลาดใจ: การ generate full joint modality ที่ test time ผลิต action คุณภาพสูงกว่าการ generate action เพียงอย่างเดียว...
งานวิจัยล่าสุดชี้ชัดว่า harness/scaffold รอบโมเดลส่งผลต่อประสิทธิภาพมากกว่าโมเดลเอง
Inherent จากอดีตทีม DeepMind เปิดตัว Faraday agent ที่เอาชนะ Claude Opus 4.8 และ GPT-5.5 ในการจำลองงานวิจัย โดยใช้โมเดลขนาดเพียง 27 พันล้านพารามิเตอร์...
แทนการวัดแค่คำตอบที่ถูกต้อง แนวทางใหม่ประเมินว่าโมเดลใช้ tools ถูกต้อง จับและแก้ไขข้อผิดพลาด พิจารณา hypotheses แข่งขัน และติดตามหลักฐานได้หรือไม่ TRACES คือ benchmark แรกสำหรับ discoverative AI ที่ชี้ทางสู่การออกแบบที่เชื่อถือได้มากขึ้น
Joon Sung Park จาก Simile AI เสนอใช้ causal data จาก pre-registered studies ฝึก digital twins เพื่อจำลองพฤติกรรมมนุษย์แบบ world model ซึ่งเป็นสถาปัตยกรรมใหม่ที่น่าจับตาสำหรับ AGI
Calibration มากกว่า capability คือหัวใจของ WorldEvolver โดย gate ช่วยให้ตัวแทนหยุดจินตนาการที่ไม่น่าเชื่อถือแทนที่จะปล่อยให้มันวางแผนต่อ foresight ราคาถูกแต่การรู้ขอบเขตความเชื่อมั่นคือสิ่งที่หายาก
บทความชี้ชัดว่า recursive self-improvement กำลังก้าวจากทฤษฎีสู่ปฏิบัติจริงผ่าน coded extensions ที่โหลดอัตโนมัติ แทนการแก้ prompt แบบเดิม