- 1테크 노트
질문이 답의 범위까지 정하고 있었습니다(1편)
역량 질문을 먼저 정하고 답에 필요한 개념을 찾는 방식이었습니다. 배송과 반품을 묻는 질문만 있으면 원문의 예외 승인 절차는 그래프에 남지 않았습니다. 질문을 빌드에서 빼고 평가에 남긴 과정입니다.
- 2테크 노트
컨텍스트를 줄이려고 자른 것이 답의 근거였습니다(2편)
관계를 여러 단계 따라가려고 멀티턴 검색을 넣었습니다. 컨텍스트가 커져 도구 결과를 500자로 잘랐더니 표와 긴 원문의 뒷부분이 합성 단계에 도달하지 못했습니다. 탐색을 넓히며 무엇을 잃었는지 정리합니다.
- 3테크 노트
몇 시간짜리 빌드를 캐시에 올려두고 있었습니다(3편)
빌드가 몇 시간으로 늘자 작업 상태를 공유 캐시에 복제했습니다. 캐시가 만료되면 취소와 재개 정보를 복원할 수 없었습니다. 실행 상태와 지식 결과를 서로 다른 저장소로 나눈 과정입니다.
- 4테크 노트
트리플 수로는 지식그래프 품질을 알 수 없었습니다(4편)
같은 파이프라인이 한쪽에서는 25만 트리플을, 다른 쪽에서는 1천 트리플을 만들었습니다. 둘 다 문제가 있었고 방향은 정반대였습니다. 적재량·구조·출처·검색·답변을 나눠 재기 시작한 과정입니다.
- 5테크 노트
그래프를 정리하다가 정상 클래스 1,500개를 지웠습니다(5편)
인스턴스와 관계가 부족한 클래스를 자동 삭제했더니 정상 클래스 약 1,500개가 함께 사라졌습니다. 추출이 아직 만들지 못한 관계를 후처리가 불필요로 판정한 것입니다. 탐지와 삭제를 나눈 과정입니다.
- 6테크 노트
느리고 부정확하다는 결과가 빈 그래프를 잰 것이었습니다(6편)
멀티턴 검색이 더 느리고 정확도도 낮다는 A/B 결과가 나왔습니다. 실행 기록을 보니 평가가 데이터 없는 그래프를 조회하고 벡터 검색만으로 답하고 있었습니다. 다시 잰 뒤 검색 구조를 바꾼 과정입니다.
- 7테크 노트
붉게 칠한 노드의 대부분은 근거가 아니었습니다(7편)
검색 품질을 높이고 화면에서 답을 검증하니 강조된 노드가 실제 근거보다 훨씬 많았습니다. 강조 범위를 줄이면서, 저희가 만든 것이 근거 추적이 아니라 문자열 대조였다는 것도 함께 확인했습니다.
- 8테크 노트
문서용 중복 정리가 정형 테이블을 합치고 있었습니다(8편)
CSV 테이블 열 개를 빌드했는데 후처리가 끝난 그래프에는 클래스가 네 개였습니다. 문서 개념을 정리하는 규칙이 스키마 식별자까지 합친 것입니다. 생성 출처를 저장해 보호 범위를 만든 과정입니다.
- 9테크 노트
작업은 성공이라고 나왔는데 그래프가 비어 있었습니다(9편)
추출 모델을 로컬 소형 모델로 바꾸자 배치가 끝나지 않거나, 성공으로 기록된 작업이 빈 그래프를 남겼습니다. 잘린 JSON과 시간 초과가 빈 결과처럼 처리되고 있었습니다. 실패를 실패로 만든 과정입니다.
- 10테크 노트
이름으로 만든 URI가 동명이인을 한 사람으로 합쳤습니다(10편)
조회 결과를 CSV로 내보내 다시 빌드하던 경로를 걷어내고 데이터베이스의 타입과 키를 그대로 썼습니다. 표시 이름을 식별자로 쓰면 동명이인이 합쳐지고 개명하면 다른 행이 됩니다. 정체성과 스냅샷 교체를 다시 설계한 과정입니다.
