Gpu

Force GPU inference for GPU-eligible Vision models. The native runtime still falls back to CPU per-session if the GPU provider can't load a given model.