Loading

Please wait a moment.

[Part 3-Final] I Distilled DeepSeek Reasoning Into My 360M Model, Then Trained It Again With RL — Reverse Engineering Notes