[바미] GPT-6 Sol·Luna가 출시되었습니다!
·
AI
OpenAI가 2026년 9월 22일 GPT-6 Sol과 GPT-6 Luna를 공개했습니다. 이달 초 출시된 GPT-6 Astra가 가장 어려운 문제를 해결하는 최상위 모델이라면 이번에 추가된 두 모델은 GPT-6의 성능을 더 낮은 비용으로 사용할 수 있도록 구성됐습니다.Astra, Sol, Luna는 무엇이 다를까요?Astra는 결과의 품질을 가장 우선해야 할 때 선택하는 모델입니다. 복잡한 연구나 중요한 의사결정처럼 비용보다 정확도와 깊이가 중요한 작업에 맞습니다. Sol은 높은 성능을 유지하면서 사용량을 늘리기 쉬운 위치에 놓였습니다. 실제 코드베이스를 수정하거나 여러 도구를 연결하는 업무, 긴 문맥을 유지해야 하는 에이전트에 적합합니다. Luna는 대량 처리와 일상적인 자동화에 초점을 둡니다. ..
[바미] 클로드 오푸스 5.5 출시 되었습니다! 코딩 성능부터 비용까지 무엇이 달라졌을까요~?
·
AI
앤트로픽이 2026년 9월 22일 Claude Opus 5.5를 공개했습니다. Claude 5.5 제품군의 첫 모델로, 대규모 코드 작업과 장시간 실행되는 에이전트, 전문 지식 업무에 초점을 맞췄습니다. 이번 발표에서 눈에 띄는 부분은 단순한 성능 향상보다 Fable 5.1에 가까운 작업 능력을 Opus 계열의 효율로 구현했다는 점입니다. Fable 5.1과 비교하면 어느 정도일까?앤트로픽은 새 모델이 대부분의 업무에서 Fable 5.1 수준으로 작동한다고 설명했습니다. 공개된 평가에서는 Terminal-Bench 4.0, FrontierCode, CursorBench처럼 실제 개발 환경과 가까운 항목에서 Fable 5.1보다 높은 점수를 기록했습니다. 지식 업무를 다루는 GDPval-AA와 컴퓨터 조작..
[바미] AI는 미래의 버그를 미리 예측할 수 있을까?
·
AI
들어가기 전에 새로운 기능을 개발했다고 가정해보겠습니다. 이 때 이걸 개발한 개발자는 전달받은 요구사항을 바탕으로 기능을 구현했습니다. 정상적인 요청뿐만 아니라 잘못된 입력과 외부 API 호출 실패 같은 예외 상황도 처리했습니다. 테스트 코드를 작성하고 개발 환경에서 여러 번 확인했지만 특별한 문제는 발견되지 않았습니다. 그런데 이 개발자는 운영을 앞두고 아래와 같은 요청을 받게됩니다.앞으로 발생할 수 있는 버그까지 미리 예측해서 개발해 주세요. 물론 가능하다면 서비스에 문제가 발생하기 전에 모든 오류를 찾아 수정하는 것이 가장 좋죠.하지만 아직 만들어지지 않은 데이터와 정해지지 않은 정책, 사용자가 앞으로 기능을 어떻게 이용할지까지 개발자가 미리 알 수 있을까요? 물론 최근에는 AI가 코드를 작성하는..
[바미] AI가 일을 대신해 주면 사람은 무엇을 준비해야 할까?
·
AI
들어가기 전에혼자서 작은 서비스를 만든다고 가정해보겠습니다. 아이디어는 있지만 화면을 만들고, 기능을 개발하고, 오류를 고치려니 할 일이 많습니다. 예전에는 사람을 더 구하거나 만들 기능을 줄여야 했을 것입니다. 그런데 AI가 코드와 문서의 초안을 만들어 준다면 어떨까요? 개발을 시작하기는 쉬워질 수 있습니다. 하지만 새로운 질문이 남습니다.만들 수 있는 것이 많아졌다면, 그중 무엇을 만들어야 할까요? 샘 올트먼의 스탠퍼드 대담은 이런 질문으로 읽어 볼 수 있습니다. AI의 성능뿐 아니라 작은 팀의 가능성, 사람들이 원하는 제품, 조직의 일하는 방식, 교육의 변화까지 이야기합니다. 이번 글에서는 대담의 주요 내용을 살펴보고, AI를 사용하는 입장에서 어떤 질문을 가져가면 좋을지 정리해보겠습니다. 이해를 ..
[바미] AI 에이전트 하나로 충분할까? 작업 흐름과 GraphRAG 이해하기
·
AI
들어가기 전에쇼핑몰 고객에게 ‘주문한 물건이 왜 아직 안 오나요?’라는 문의가 들어왔다고 해봅시다.AI가 자연스러운 문장을 만드는 것만으로 이 질문에 답할 수 있을까요? 먼저 어떤 주문인지 확인해야 합니다. 주문 처리 상태와 택배 이동 기록을 찾아야 하고, 두 정보를 비교해야 합니다. 보상 요청까지 포함되어 있다면 담당자의 판단이 필요할 수도 있습니다.답변을 잘 만드는 것과, 답변에 필요한 일을 순서대로 처리하는 것은 다른 문제입니다. Google Cloud Tech 영상은 그래프 설계와 GraphRAG 실습을 통해 AI가 여러 작업과 데이터를 연결하는 과정을 보여줍니다. 이 글은 그 내용을 중심으로 정리했습니다. 내용은 크게 두 가지입니다. 어떤 일을 어떤 순서로 처리할 것인가와 ‘답변에 필요한 정보를..
[바미] Claude와 Figma를 연결하면 화면 디자인부터 웹페이지까지 만들 수 있을까?
·
AI
들어가기 전에반려견의 산책 시간과 병원비를 기록하는 웹사이트를 만든다고 가정해보겠습니다.처음에는 필요한 화면이 많지 않아 보입니다. 회원가입 화면을 만들고, 반려견을 등록하고, 기록을 보여주면 될 것 같습니다.하지만 화면을 하나씩 만들다 보면 생각보다 정해야 할 것이 많습니다.회원가입은 어떤 순서로 진행할까요?휴대전화와 PC에서는 화면을 어떻게 배치할까요?버튼 색과 글자 크기는 어떻게 맞출까요?나중에 대표 색상을 바꾸면 모든 화면에 한꺼번에 적용할 수 있을까요?Figma에서 만든 디자인이 실제 웹사이트에서도 똑같이 보일까요?AI에게 화면을 만들어 달라고 요청할 수는 있습니다. 다만 화면이 빨리 나왔다고 해서 위의 문제가 모두 해결되는 것은 아닙니다.가입 화면의 버튼은 초록색인데 대시보드의 버튼은 파란색일..
[바미] AI가 일하는 시대, 나는 어떤 개발자가 되어야 할까
·
AI
들어가기 전에지난 6월, 하용호 님의 AI시대 나의 전문성을 재설계하는 법 강연을 들었다. 강연을 본 직후부터 내용을 정리해두고 싶었지만, 업무와 여러 일정이 겹치면서 한 달 넘게 미루다가 이제야 글로 남기게 됐다. 시간이 조금 지난 뒤 다시 발표 자료를 살펴보니 당시에는 흥미롭게만 들었던 이야기들이 실제 업무를 하면서 더 구체적으로 와닿았다. 특히 AI가 만들어주는 결과물의 양이 점점 늘어나면서 단순히 AI를 잘 사용하는 것보다 그 결과를 이해하고 검증하며 책임지는 능력이 중요하다는 생각을 자주 하게 됐다. 그래서 이번 글에서는 강연의 모든 내용을 그대로 요약하기보다 개발자로 일하는 내 입장에서 특히 인상 깊었던 부분과 앞으로 어떤 개발자가 되어야 할지에 대해 고민한 내용을 정리해보려고 한다.AI를 많..
[바미] Recall이 높아지면 사용자는 정말 만족할까?
·
AI
들어가기 전에RAG의 검색 성능을 개선하기 위해 새로운 Reranker를 적용했다고 가정해보겠습니다. 오프라인 평가 결과는 좋아졌습니다.평가항목적용 전적용 후Recall@50.780.85NDCG@50.720.80답변 정확도0.740.77 정답 문서가 상위 검색 결과에 더 자주 포함되었고, 중요한 문서의 순위도 높아졌습니다. 최종 답변 정확도 역시 조금 개선되었습니다.이 정도 결과라면 새로운 설정을 운영 환경에 적용해도 될 것처럼 보입니다. 그런데 실제 사용자 반응은 예상과 달랐습니다. 사용자 행동적용 전적용 후긍정 피드백 비율72%69%재질문 비율11%15%답변 후 업무 완료율68%65%p95 응답 시간3.2초6.1초요청당 평균 비용12원21원 검색 점수와 답변 정확도는 좋아졌는데 사용자는 오히려 더 ..
[바미] 운영 중인 RAG는 어떻게 디버깅할까?
·
AI
들어가기 전에오프라인 평가에서는 잘 동작하던 RAG를 실제 서비스에 적용했다고 가정해보겠습니다. 며칠 뒤 사용자로부터 다음과 같은 문의가 들어왔습니다.같은 질문을 했는데 어제와 오늘 답변이 달라요. 다른 사용자는 답변이 너무 느리다고 말합니다. 또 누군가는 검색 결과에 정답 문서가 있는데도 잘못된 답을 받았다고 합니다.이때 최종 질문과 답변만 저장해두었다면 문제의 원인을 찾기 어렵습니다.답변이 틀린 이유는 여러 가지일 수 있기 때문입니다.사용자의 질문을 검색어로 바꾸는 과정에서 중요한 조건이 빠졌을 수 있습니다.Retriever가 관련 없는 문서를 가져왔을 수 있습니다.정답 문서를 찾았지만 Reranker가 낮은 순위로 내렸을 수 있습니다.검색된 문서가 최종 Context를 만드는 과정에서 제외되었을 수..
Bami
기록하며 성장하기