[바미] RAG는 왜 틀린 답을 할까?

·
AI
들어가기 전에RAG의 성능을 평가했더니 점수가 낮게 나왔다고 가정해보겠습니다. Recall이 낮을 수도 있고, 답변 정확도가 기대보다 떨어질 수도 있습니다. 사용자들이 계속 비슷한 질문을 다시 묻거나 답변에 도움이 되지 않았다는 평가를 남길 수도 있죠. 문제가 있다는 사실은 알게 되었습니다. 그런데 점수가 낮다는 것만으로는 무엇을 고쳐야 할지 알 수 없습니다. 임베딩 모델을 바꿔야 할까요? 문서를 나누는 방법을 바꿔야 할까요? 검색 결과를 더 많이 가져와야 할까요? 아니면 LLM에 전달하는 명령을 수정해야 할까요? 원인을 확인하지 않고 여러 설정을 한꺼번에 바꾸면 운이 좋을 때는 점수가 오를 수 있습니다. 하지만 어떤 변경이 효과가 있었는지는 알기 어렵습니다. 점수가 오히려 떨어졌을 때도 어느 부분을 되..