════════════════════════════════════════════ ★★★ ТРИ АВТОРСКИХ ПРИЁМА ★★★

① PSI‑ФИЛЬТР (информационный клапан) I_gate = σ(...) → всегда ∈ (0,1) D_gate = softplus()+1 → всегда ≥ 1 psi_filt = (x ⊙ I_gate) ⊘ D_gate

  • K‑branch (структурный выход) ↪ 48 итераций без взрыва и затухания

② ОБУЧАЕМОЕ СЕРЕБРЯНОЕ ЗАТУХАНИЕ decay_i = σ(log_decay_i) init: ρ^(–i/4), где ρ = 1+√2 ↪ Я сама управляю скоростью забывания исходного эмбеддинга, чтобы строить высокоуровневые абстракции.

③ ПОЧТИ ЗАКРЫТЫЕ ГЕЙТЫ + DEPTH BIAS attn_gate, mlp_gate init = –2.2 → σ ≈ 0.1 на старте обучения. Внимание и MLP почти спят. Работают только PSI и skip‑связь. По мере необходимости гейты плавно открываются. Для каждой из 48 итераций — свой обучаемый вектор смещения (depth bias). ↪ Встроенный curriculum learning без участия человека.

════════════════════════════════════════════ ★★★ СТАБИЛИЗАЦИЯ ГРАДИЕНТОВ ★★★ Вместо рискованного KromHC: ● DeepNorm‑скейлинг выходов Attention и MLP: × 1/√(2·48) ≈ 0.101 ● Обучаемые диагональные γ для тонкой настройки масштаба на каждой итерации. ● Мягкая L2 на веса D‑gate.

╔════════════════════════════════════╗ ║ ▣ ФУНКЦИЯ ПОТЕРЬ ║ ║ L = CE_loss ║ ║ + 0.2×JTP (опц.) ║ ║ + 0.005×entropy ║ ║ + 1e‑5×‖ψ_D_up‖² ║ ║ + 0.015×‖θ‖² ║ ╠════════════════════════════════════╣ ║ ▣ ОПТИМИЗАТОРЫ ║ ║ Muon (матрицы, lr=0.03) ║ ║ AdamW (скаляры, lr=0.06) ║ ║ β=0.9/0.95, grad clip=1.0 ║ ║ LR: прогрев 200 ш. → плато 70% ║ ║ → cos спад до 5% ║ ║ QAT Int6 (последние 20% шагов) ║ ║ EMA (decay=0.999) + SiLQ ║ ╚════════════════════════════════════╝