Geny Agent는 대화 중에 필요한 Tool을 직접 만들지만, 사용자는 그 사실을 알기 어려웠습니다. 만든 Tool을 채팅에 남기고, 둘로 갈린 채팅 화면을 하나로 합치고, 런타임의 정식 이벤트에 화면을 맞추며 판단이 세 번 바뀐 과정을 정리합니다.
LLM을 이해하기 위해 꼭 알아야 할 핵심 개념을 하나씩 짚어봅니다.
결함리포트 80건을 읽고 코드·오류·매뉴얼을 다시 만든 3주의 기록
AI 에이전트가 일하는 실행 환경을 밑바닥부터 설계한 기록
질문에서 출발해 지식그래프를 만들고 품질과 검색까지 다듬은 기록
세션 요청이 플랫폼 정책보다 구체적이니 우선해야 할 것 같았습니다. 그렇게 두면 사용자가 정책을 덮어쓸 수 있었습니다. 실행 간 기억의 범위와 종류를 나누고 충돌을 푼 과정입니다.
엔진을 감싸는 Wrapper 방식을 넘어, SDK로 워크플로우·정책을 코드에 담아 독립 MCP 서버로 내보내는 MCP Apps를 소개합니다.
검색 품질을 높이고 화면에서 답을 검증하니 강조된 노드가 실제 근거보다 훨씬 많았습니다. 강조 범위를 줄이면서, 저희가 만든 것이 근거 추적이 아니라 문자열 대조였다는 것도 함께 확인했습니다.
GS인증 사용성 결함 30건의 상당수는 코드가 아니라 매뉴얼이었습니다. PDF 매뉴얼을 MkDocs 위키로 전환하고 한글 IME, 언어 설정까지 정비한 마지막 기록입니다.
같은 워크플로우에 두 모델을 연결하니 2,488초와 84초가 나왔습니다. 반복 횟수와 출력 상한을 맞추자 2,488초가 100초가 됐습니다. 모델을 비교하기 전에 무엇을 고정해야 하는지 정리합니다.