Diagnostics
Troubleshooting & Diagnostics
Quickly resolve common CUDA allocator errors, driver incompatibilities, and dataset format warnings.
1. Run System Health Check
moro doctor
2. CUDA Out Of Memory (OOM) Errors
If training experiences memory pressure despite auto-recovery, adjust your configuration:
- Enable gradient checkpointing:
gradient_checkpointing: trueinmoro.yaml. - Reduce micro-batch size to 1 and double gradient accumulation:
micro_batch_size: 1. - Clamp sequence length:
max_seq_length: 1024.
3. MPS Accelerator (Apple Silicon)
On Apple Silicon M-series Macs, ensure PyTorch uses MPS:
export PYTORCH_ENABLE_MPS_FALLBACK=1 moro diagnose