figure.2

10. Tool Call 불안정성, 평가 한계, 그리고 Lumi_agent 회고

Lumi_agent에서 가장 많이 배운 점은 Agent 프로젝트가 “모델이 똑똑하면 끝”이 아니라는 것이다. 외부 도구 실행, 사용자 승인, 기억 검색, GUI 이벤트 루프, 페르소나 유지가 모두 같이 맞아야 사용자가 하나의 비서처럼 느낀다. 자체 평가 당시 회고에는 목표 기능의 약 85% 정도를 수행했다고 판단했다는 내용이 남아 있다. 이 숫자...

Agent Architecture 수업 기록

Agent Architecture 수업 기록 수업 위치 이 수업은 Product Engineering 단계에서 만든 에이전트 아이디어를 실제 서비스 구조로 옮기는 출발점이다. 강의자료의 핵심은 “노트북에서 돌아가는 코드”와 “다른 사람이 접속해서 쓸 수 있는 서비스”는 다르다는 점이다. 노트북은 실험에는 좋지만 서비스 운영에는 부족하다. 요청을 ...

09. Agent 품질을 어떻게 평가하려 했는가

Agent 평가는 정답률 하나로 끝나지 않는다. Lumi_agent처럼 페르소나, 기억, 도구 호출, 승인 경계가 섞인 시스템은 무엇을 평가할지부터 나눠야 한다. 그래서 이 글은 성능 결과표가 아니라 평가 설계 자체를 다룬다. 어떤 기준으로 Agent를 봐야 하는지, 그리고 어떤 범위까지 말할 수 있는지를 분리한다. 평가해야 할 것 Lumi_ag...