성능
9편의 기록
모델은 점수가 아니라 방법으로 고른다
리더보드 1.38pt 차이는 노이즈였다. 교체 판단은 사전 동결한 decision rule과 자기 워크로드 실측이 만든다.
에이전트 기억은 조회를 믿으면 안 된다
1주 211건 운영 실측에서 recall 재현율은 15.6%였다. 조회는 완전성을 보장하지 않는다.
측정하지 않은 것을 측정했다고 하지 않는다
조건 라벨을 뗀 수치는 측정이 아니라 주장이다. 라벨과 함께 쓸 수 없는 수치는 버린다.
기업이 AI 에이전트를 망설인 진짜 이유는 성능이 아니었다
앤트로픽이 self-hosted 샌드박스와 MCP 터널로 도입 장벽을 겨눴다. 에이전트가 회사 보안 경계 밖으로 나가지 않는다.
GPT-5.5 다음 주 출시 거의 확실하다?
트윗 하나에 Polymarket 확률이 87%까지. 루머를 믿지 말고 검증 절차를 믿는다, 4일 뒤 자동으로 답이 나온다.
해커는 악성코드를 .pdf로 위장한다
확장자 위장 파일을 밀리초 만에 판별하는 Google의 AI 도구 Magika. 정확도 99%, Gmail과 Drive에서 실전 검증됐다.
AI가 인간을 추월한다고?
Nature 보도, 복잡한 과제에선 인간 과학자가 최고 AI 에이전트를 크게 앞선다. 단순 반복은 AI, 복잡한 판단은 인간의 분업이 답.
AI 채택 속도, PC와 인터넷을 넘어섰다
PC 15년, 인터넷 10년 걸린 보급 곡선을 AI가 앞질렀다. 다만 도입률과 활용 깊이는 별개 지표다. 스탠퍼드 AI Index 2026.
모델을 고르는 능력보다 바꿀 수 있는 구조가 중요하다
7개월간 5개 모델, '최신'의 유통기한이 주 단위로 줄었다. OpenAI 코드네임 Spud로 읽는 모델 비종속 전략.