[바미] AI가 일하는 시대, 나는 어떤 개발자가 되어야 할까
·
AI
들어가기 전에지난 6월, 하용호 님의 AI시대 나의 전문성을 재설계하는 법 강연을 들었다. 강연을 본 직후부터 내용을 정리해두고 싶었지만, 업무와 여러 일정이 겹치면서 한 달 넘게 미루다가 이제야 글로 남기게 됐다. 시간이 조금 지난 뒤 다시 발표 자료를 살펴보니 당시에는 흥미롭게만 들었던 이야기들이 실제 업무를 하면서 더 구체적으로 와닿았다. 특히 AI가 만들어주는 결과물의 양이 점점 늘어나면서 단순히 AI를 잘 사용하는 것보다 그 결과를 이해하고 검증하며 책임지는 능력이 중요하다는 생각을 자주 하게 됐다. 그래서 이번 글에서는 강연의 모든 내용을 그대로 요약하기보다 개발자로 일하는 내 입장에서 특히 인상 깊었던 부분과 앞으로 어떤 개발자가 되어야 할지에 대해 고민한 내용을 정리해보려고 한다.AI를 많..
[바미] Recall이 높아지면 사용자는 정말 만족할까?
·
AI
들어가기 전에RAG의 검색 성능을 개선하기 위해 새로운 Reranker를 적용했다고 가정해보겠습니다. 오프라인 평가 결과는 좋아졌습니다.평가항목적용 전적용 후Recall@50.780.85NDCG@50.720.80답변 정확도0.740.77 정답 문서가 상위 검색 결과에 더 자주 포함되었고, 중요한 문서의 순위도 높아졌습니다. 최종 답변 정확도 역시 조금 개선되었습니다.이 정도 결과라면 새로운 설정을 운영 환경에 적용해도 될 것처럼 보입니다. 그런데 실제 사용자 반응은 예상과 달랐습니다. 사용자 행동적용 전적용 후긍정 피드백 비율72%69%재질문 비율11%15%답변 후 업무 완료율68%65%p95 응답 시간3.2초6.1초요청당 평균 비용12원21원 검색 점수와 답변 정확도는 좋아졌는데 사용자는 오히려 더 ..
[바미] 운영 중인 RAG는 어떻게 디버깅할까?
·
AI
들어가기 전에오프라인 평가에서는 잘 동작하던 RAG를 실제 서비스에 적용했다고 가정해보겠습니다. 며칠 뒤 사용자로부터 다음과 같은 문의가 들어왔습니다.같은 질문을 했는데 어제와 오늘 답변이 달라요. 다른 사용자는 답변이 너무 느리다고 말합니다. 또 누군가는 검색 결과에 정답 문서가 있는데도 잘못된 답을 받았다고 합니다.이때 최종 질문과 답변만 저장해두었다면 문제의 원인을 찾기 어렵습니다.답변이 틀린 이유는 여러 가지일 수 있기 때문입니다.사용자의 질문을 검색어로 바꾸는 과정에서 중요한 조건이 빠졌을 수 있습니다.Retriever가 관련 없는 문서를 가져왔을 수 있습니다.정답 문서를 찾았지만 Reranker가 낮은 순위로 내렸을 수 있습니다.검색된 문서가 최종 Context를 만드는 과정에서 제외되었을 수..
[바미] RAG는 어떤 질문에 약할까?
·
AI
들어가기 전에같은 RAG에 다음 두 질문을 입력했다고 가정해보겠습니다. 첫 번째 질문입니다.A사의 2025년 2분기 영업이익은 얼마인가요?RAG는 관련 문서를 검색하고 정확하게 답했습니다. 두 번째 질문입니다.A사와 B사 중 2025년 2분기에 영업이익이 더 많이 증가한 회사는 어디인가요?이번에는 틀린 답을 내놓았습니다. 두 질문 모두 같은 문서와 같은 검색 모델, 같은 LLM을 사용했습니다. 그런데 질문의 형태가 조금 달라지자 결과가 달라졌습니다.첫 번째 질문은 하나의 문서에서 숫자 하나를 찾으면 답할 수 있습니다.두 번째 질문에 답하려면 더 많은 과정이 필요합니다.A사의 2024년 2분기 영업이익 찾기A사의 2025년 2분기 영업이익 찾기B사의 2024년 2분기 영업이익 찾기B사의 2025년 2분기 ..
[바미] 문서를 잘게 쪼갰더니 오히려 답을 못 찾았습니다
·
AI
들어가기 전에RAG의 검색 성능을 높이기 위해 청크 크기를 줄였다고 가정해보겠습니다. 기존에는 문서를 500자씩 나눴지만, 더 정확한 내용을 찾을 수 있을 것 같아 200자씩 나누도록 변경했습니다.변경 전→ 청크 크기 500자변경 후→ 청크 크기 200자청크가 작아지면 하나의 청크에 담기는 주제가 더 명확해질 것 같습니다. 불필요한 내용도 줄어들고, 사용자의 질문과 직접 관련된 문장만 검색할 수 있을 것처럼 보이죠? 그런데 평가 결과는 예상과 달랐습니다.변경 전 Recall@5: 0.78변경 후 Recall@5: 0.66청크를 더 작게 나눴는데 오히려 정답을 찾지 못하는 질문이 늘었습니다. 왜 이런 일이 발생했을까요? 다음과 같은 사내 규정이 있다고 가정해보겠습니다.입사 1년 미만 직원의 연차 기준입사한..
[바미] 검색 결과 순서만 바꿨는데 답변이 좋아질까?
·
AI
들어가기 전에RAG가 사용자의 질문과 관련된 문서를 검색했다고 가정해보겠습니다.정답이 들어 있는 문서도 검색 결과에 포함되어 있습니다. 그런데 최종 답변은 틀렸습니다. 검색에 성공했는데 왜 답변은 틀린 걸까요? 검색 결과가 다음과 같은 순서로 나왔을 수 있습니다.1위: 2024년 2분기 실적 보고서2위: 2025년 1분기 실적 보고서3위: 회사 소개 자료4위: 2025년 2분기 실적 보고서5위: 채용 공고사용자의 질문은 다음과 같습니다.A사의 2025년 2분기 영업이익은 얼마인가요?정답은 4위 문서에 들어 있습니다.하지만 RAG가 상위 3개의 문서만 LLM에 전달한다면 정답 문서는 검색되었어도 답변을 만드는 데 사용되지 못합니다.검색 결과에는 정답 문서가 있음하지만 LLM에 전달된 문서에는 없음이 때 정..
[바미] RAG가 좋아진 이유가 정말 그 설정 때문일까?
·
AI
들어가기 전에RAG의 답변 품질이 기대보다 낮아서 여러 설정을 바꿨다고 가정해보겠습니다. 벡터 검색에 BM25를 추가하고, 검색된 문서의 순서를 다시 정하는 Reranker도 붙였습니다. 질문을 검색하기 좋은 형태로 바꾸는 Query Expansion을 적용하고, 청크 크기도 500자에서 300자로 줄였습니다.수정이 끝난 뒤 다시 평가해보니 답변 정확도가 높아졌습니다.수정 전 답변 정확도: 68%수정 후 답변 정확도: 79%분명 좋은 결과입니다. 그런데 여기서 한 가지 문제가 생깁니다. 과연 정확도가 높아진 이유는 무엇일까요? BM25를 추가한 것이 효과가 있었을까요? Reranker가 정답 문서를 위로 올려준 것일까요? Query Expansion이 사용자의 질문을 더 잘 이해하게 만든 것일까요? 청..
[바미] RAG는 왜 틀린 답을 할까?
·
AI
들어가기 전에RAG의 성능을 평가했더니 점수가 낮게 나왔다고 가정해보겠습니다. Recall이 낮을 수도 있고, 답변 정확도가 기대보다 떨어질 수도 있습니다. 사용자들이 계속 비슷한 질문을 다시 묻거나 답변에 도움이 되지 않았다는 평가를 남길 수도 있죠. 문제가 있다는 사실은 알게 되었습니다. 그런데 점수가 낮다는 것만으로는 무엇을 고쳐야 할지 알 수 없습니다. 임베딩 모델을 바꿔야 할까요? 문서를 나누는 방법을 바꿔야 할까요? 검색 결과를 더 많이 가져와야 할까요? 아니면 LLM에 전달하는 명령을 수정해야 할까요? 원인을 확인하지 않고 여러 설정을 한꺼번에 바꾸면 운이 좋을 때는 점수가 오를 수 있습니다. 하지만 어떤 변경이 효과가 있었는지는 알기 어렵습니다. 점수가 오히려 떨어졌을 때도 어느 부분을 되..
[바미] 검색 결과는 몇 개까지 봐야 할까? - 상위 K개 평가 이해하기
·
AI
들어가기 전에검색 시스템에 질문을 입력하면 보통 하나의 문서만 나오는 것이 아니라, 질문과 관련 있다고 판단한 문서들이 순서대로 나옵니다.예를 들어 사내 규정에 관해 질문했을 때 검색 결과가 100개 나왔다고 가정해보겠습니다. 이 100개를 모두 확인할 수는 없으니 실제로는 상위 몇 개의 결과만 사용하게 됩니다. 웹 검색에서는 첫 페이지에 나온 결과만 살펴보는 경우가 많고, RAG에서는 검색 결과 중 일부 문서만 LLM에 전달합니다.그렇다면 검색 성능을 평가할 때도 전체 결과가 아니라 실제로 사용하는 범위까지 확인해야 합니다.이때 사용하는 지표가 Precision@K와 Recall@K입니다. 이름에 수식처럼 보이는 기호가 들어가서 처음에는 어렵게 느껴질 수 있지만 의미는 단순합니다.@K→ 검색 결과를 위..
Bami
기록하며 성장하기