Diagnostics

Troubleshooting & Diagnostics

Quickly resolve common CUDA allocator errors, driver incompatibilities, and dataset format warnings.

1. Run System Health Check

moro doctor
  

2. CUDA Out Of Memory (OOM) Errors

If training experiences memory pressure despite auto-recovery, adjust your configuration:

  • Enable gradient checkpointing: gradient_checkpointing: true in moro.yaml.
  • Reduce micro-batch size to 1 and double gradient accumulation: micro_batch_size: 1.
  • Clamp sequence length: max_seq_length: 1024.

3. MPS Accelerator (Apple Silicon)

On Apple Silicon M-series Macs, ensure PyTorch uses MPS:

export PYTORCH_ENABLE_MPS_FALLBACK=1
moro diagnose