ODYSSEY
·
FLOWDAGGER
↺ MISSION ARCHITECTURE / NOISE STEERING
CLICK THE DIAGRAM TO ADVANCE ·
←
→
TO NAVIGATE
Steering a frozen policy through its noise
π0.5 pilot · UR10e drug-sort · one control cycle, step by step
EXECUTION · AT DEPLOYMENT
TRAINING · FROM CORRECTIONS
s
STATE
TRAINABLE · 5.9 MB
LATENT POLICY
π
w
(s)
learns where to sample
w ∼ π
w
(s)
INITIAL NOISE
❄ FROZEN · NEVER UPDATED
BASE POLICY
π
gp
(s, w)
flow ODE · noise → action
a
ACTION CHUNK 10×7
ENVIRONMENT
UR10e · playground sim
s′
NEXT CYCLE
EXPERT
SPARSE OVERRIDE
a*
EXECUTED CORRECTION
ACTION INVERSION
π
gp
(s, w*) ≈ a*
reverse-time integration
+ fixed-point refinement
action → noise
w*
NOISE TARGET
LATENT-SPACE REGRESSION
𝓛 = ‖w − w*‖²
supervised pairs (s, w*)
plain SFT — in noise space
POLICY UPDATE
ONLY π^w TRAINS
TRAINABLE
FROZEN
EXPERT / CORRECTION
00
/ 08
← BACK
NEXT →
↺ RESET