Verdicts

판정문

질문, 판정, 근거와 재검토 트리거를 한 곳에서 본다.

판정 ·8분 읽기

Upstage API 하루 실측, 정확도를 맨 나중에 재기로 했다

영수증 50장에서 상호명 F1이 76%로 나왔다. 오답 14건을 원본과 대조하니 모델이 틀린 것은 1건이었고 나머지는 정답 쪽과 내가 쓴 스키마 문구가 만들었다.

판정 ·4분 읽기

Gemini 무료 계정, 하루 5회라던 한도를 직접 세어봤다

무료 계정만으로 따라올 수 있어야 하는 소상공인 AI 교육을 만들다 보니 무료 한도가 교재의 사실 주장이 됐다. 문서와 커뮤니티의 숫자를 직접 확인하자 세 항목이 달랐다.

판정 ·4분 읽기

표준이라던 TEI 추론 서버가 내 맥에서는 10배 느렸다

개인 메모리 검색을 죽이던 리랭킹 35~55초를 표준 해법인 TEI로 고치려다 실측에서 기각했다. 채택 근거는 벤더가 발표한 수치가 아니라 내 기계에서 나온 숫자다.

판정 ·3분 읽기

18건 저장 성공이라던 보고, 실제 저장은 0건이었다

개인 메모리뱅크(Hindsight-Crew)에 기록 18건을 저장하는 호출이 전부 실패했는데 에이전트의 보고는 성공이었다. 발각은 자동 검증이 아니라 사람의 지적이었다.

판정 ·3분 읽기

재현율 0.45, 검색기를 고치기 전에 빠진 22건을 열어봤다

팀 메모리 시스템(Hindsight)으로 쓴 보고서의 활동 재현율이 목표 0.95에 크게 못 미쳤다. 검색기를 손보기 전에 분모부터 열자 빠진 22건 중 진짜 손실은 1건이었다.

판정 ·3분 읽기

통화 기록의 행을 그대로 세니 통화가 40% 부풀려졌다

통화 SaaS가 내보낸 원천 테이블의 행을 그대로 세면 통화 건수가 약 40% 부풀려졌다. 그 숫자가 영업사원 역량 평가의 분모로 들어갈 예정이었다.

판정 ·3분 읽기

표본 17건으로는 0.021 차이를 승자로 부를 수 없었다

한국어 임베딩 세 후보(arctic-ko, KURE-v1, BGE-m3-ko) 중 KURE-v1이 0.021 앞섰지만 표본이 미리 얼려둔 최소치에 못 미쳤다. 규칙을 고치지 않고 승자 없음으로 닫았다.