별도의 테스트셋은 구성하지 않았으며, 검증 손실 기준으로 최적 체크포인트를 저장했습니다.
| 항목 | 내용 |
| 모델 유형 | 가치 신경망 (Value Network) — 회귀(Regression) |
| 아키텍처 | CNN — Conv 3블록(18→64→128→128) + 완전연결 헤드 |
| 파라미터 수 | 약 2,329,857개 |
| 입력 / 출력 | 18×8×8 텐서 / 단일 스칼라값 (−1 ~ +1) |
| 손실 함수 | MSE |
| 옵티마이저 | Adam (lr=3×10⁻⁴, weight_decay=1×10⁻⁴) |
| 그래디언트 클리핑 | max_norm=1.0 (전체 스텝의 68.2% 발동) |
| LR 스케줄러 | ReduceLROnPlateau (factor=0.5, patience=3) — 총 5회 감소 |
| 학습률 변화 | 3×10⁻⁴ → 1.5×10⁻⁴ → 7.5×10⁻⁵ → 3.75×10⁻⁵ → 1.87×10⁻⁵ → 9.37×10⁻⁶ |
| 초기 검증 손실 (epoch 1) | 0.0747 |
| 최종 검증 손실 (epoch 50) | 0.0437 |
| 탐색 | Negamax (2-ply) |
| 학습 프레임워크 | PyTorch |
| 학습 하드웨어 | NVIDIA RTX 4080 Super |
| 학습 소요 시간 | 약 10시간 49분 (50 에폭) |