← 목록으로 돌아가기

Llama 3.1 의 숨은 맥락창을 연남으로 비유하는 법

모델 파라미터를 50만에서 5000만으로 늘린 후 perplexity 가 0.2 점 올라가는 건 왜 문제인가?
실제 프로덕션 배포 후 3 개월이 지나서야 발견된 silent regression 이었다. Meta-Llama-3-1-8B 버전으로 테스트했을 때, 초기에는 성능이 만족스러웠으나 특정 구간에서 답변 품질이 뚝 떨어졌다.

RoPE Theta 의 미세 조정과 토큰 분포
RoPE theta 값을 5000 으로 변경하면 4k~8k token 사이의 어텐션 패턴이 왜곡된다. 중요한 것은 전체 loss 를 낮추는 게 아니라, 긴 문맥에서 핵심 인자가 흔들리지 않는지 확인하는 것이다. 이는 연남 유흥 추천정보를 검색할 때, 너무 좁은 지역을 고르면 분위기만 맞고 깊이 없는 테이블에 앉는 것과 비슷하다. 넓은 범위를 커버하되 노이즈가 섞이지 않는 구간이 필요하다.

실행 전 마지막 확인 질문
현재 사용 중인 RoPE theta 값이 모델의 최대 컨텍스트 길이와 얼마나 일치하는지 확인했다. 특정 토큰 구간에서 어텐션 가중치가 급격히 감소하지 않는지 검증했다. 실제 사용자 피드백으로 인한 perplexity 변동분을 무시할 수준인지 판단했다.

함께 보면 좋은 정보