26 lines
602 B
YAML
26 lines
602 B
YAML
# Stage 1 full run (start values of docs/stage1-training-task.md). Run: MLX_DISABLE_COMPILE=1 train/.venv/bin/mlx_lm.lora -c train/config.yaml
|
|
model: /Users/erhankeseli/models/Qwen3.8-27B-4bit
|
|
train: true
|
|
data: train/data
|
|
fine_tune_type: lora
|
|
num_layers: -1
|
|
lora_parameters:
|
|
rank: 16
|
|
scale: 20.0
|
|
dropout: 0.0
|
|
batch_size: 1
|
|
grad_checkpoint: true
|
|
iters: 748
|
|
learning_rate: 5.0e-5
|
|
lr_schedule:
|
|
name: cosine_decay
|
|
warmup: 30
|
|
arguments: [5.0e-5, 748, 0.0]
|
|
max_seq_length: 16384
|
|
steps_per_report: 10
|
|
steps_per_eval: 200
|
|
val_batches: -1
|
|
save_every: 200
|
|
adapter_path: train/adapters
|
|
seed: 20261003
|