에이전트
에이전트를 세우고 굴리는 법. 하네스, 스킬, 훅, 멀티에이전트 운용에서 나온 판정과 기록이다.
35편의 기록
판정
아티클
에이전트가 쓴 기록에 등급을 매기려고 증거 종류를 셋으로 늘렸다
석 달 치 작업 이력을 사료로 정리하면서 실측과 구술 2분법이 서지 않는 자리를 찾고, 에이전트 자기 기록을 세 번째 범주로 세운 기록
블로커 판정 두 건을 오진으로 뒤집고 지침에 한 줄을 넣었다
브라우저 자동화 도구 aside와 배포 도구 Wrangler에서 나온 블로커 판정 두 건이 각각 모델 명시와 계정 식별자 지정으로 뒤집혔고, 그 경험이 에이전트 지침 조항이 된 기록
임원 보고서에 Claude 이름을 그대로 적고 규칙 넷을 세웠다
제조업 기반 중견기업에서 임원 보고 문서를 언어 모델 보조로 만든 여섯 주 동안 세워진 보고 규율 네 가지와, 그 각각을 만든 사건
자기 진단 네 건을 뒤집고 뒤집은 절차에 이름을 붙였다
라우팅 폴백 판정, 캐시 조사의 기각 판정, 컨텍스트 절벽 진단, 비교 대상 제품에 0.0을 준 벤치 결과까지 자기 진단 네 건이 뒤집힌 기록과 각각을 뒤집은 재검증 절차
AI 냄새 제거 도구 20종을 고르다 도구 대신 4단 게이트를 세웠다
한국어 AI 냄새 제거 도구 20종을 갈라 humanizer 스킬(DaleSeo/korean-skills) 하나를 발행 전 게이트로 채택한 기록. 값은 도구 이름보다 층 배치와 기각권에서 나왔다.
네 번 접고 두 번 보류했다 - 접는 판단에 붙은 조건
김밥집, 기계학습 트랙, 연습용 제품 OurFolio, 프리랜서 하선까지 네 번의 큰 접기가 같은 조건을 썼고, 접지 않은 두 건이 그 조건을 증명한다
뮤테이션 59종을 붙인 점검 스크립트가 라우팅보다 먼저 깨졌다
라우팅 점검 스크립트를 만든 사흘 동안 그 스크립트 자체를 뮤테이션 59종으로 두들겨 생존 7건을 닫았고, 그 투자는 8월 중순 상류가 설정 테이블을 옮긴 날에 정산됐다
서사
커리어 전환기 0-1편 - 예외부터 세는 버릇
관제센터에서 보낸 2년 4개월과 거기서 남은 일하는 순서
커리어 전환기 0-2편 - 장부에 없던 이유
김밥집을 데이터로 굴리다가 잘 되던 그 가게를 접기까지
커리어 전환기 0-3편 - 모델 대신 시스템 쪽에 서기로 했다
부트캠프 7개월과 에이전트 태동기를 겹쳐 지나며 자기 층위를 갈라낸 기록
커리어 전환기 1편 - 31일 중 31일
솔로프리너 전환에서 자작 메모리 시스템까지 넉 달의 기록
커리어 전환기 2편 - 정직한 상한
로컬 AI 조직에서 장비 상한과 지표 분모를 다시 잰 5월의 기록
커리어 전환기 3편 - 줄여서 닫는 법
장비 회수로 끝난 6주와 줄여서 닫은 인수인계의 기록
커리어 전환기 4편 - 닫기 위한 작업량
제주에서 시작한 교육 자산부터 표면 감사와 감량까지 두 달의 기록
노트20편
LobeHub이 자기 포지셔닝을 조용히 바꿨다
도구가 아니라 '에이전트 직원을 채용, 관리, 보고받는 운영 플랫폼'으로. 사람이 에이전트 팀의 매니저가 되는 프레임.
깃허브에서 하루에 별이 93개씩 쌓이는 리포가 있다
자율 코딩 에이전트 OpenHands. 제번스 역설대로면 코드는 줄지 않고 폭증한다, 병목은 생성이 아니라 검증으로 옮겨간다.
명령을 기다리지 않는 24시간 에이전트, Gemini Spark
'지시하면 처리'에서 '상시 위임'으로 넘어가는 첫 메이저 시도. 권한 위임 범위, 감사 경로, 회수 버튼이 다음 쟁점이다.
AI 에이전트가 굴리는 헷지펀드, 별 5.8만의 의미
애널리스트, 리스크, 포트폴리오 매니저를 에이전트가 분담한다. 창조적 파괴가 직무가 아니라 분업 구조 전체를 노린다.
앱을 누르는 게 아니라, 앱한테 부탁한다
구글 Gemini Intelligence가 폰을 직접 조작하기 시작했다. AI에게 깊은 권한을 주는 만큼 공격 표면도 커진다.
챗봇을 코드 없이 짜는 도구가 스타 14만 개를 찍었다
Dify가 스타 14만을 찍으며 '팀이 굴리는 에이전트' 카테고리를 열었다. 다음 병목은 권한 위임과 감사 로그다.
앤트로픽, 금융 에이전트 10개를 오픈소스로 풀었다
피치북 제작부터 KYC 심사까지 에이전트 10개가 한 리포에. MCP 커넥터 11개로 실무 금융 데이터에 직접 붙는다.
AI 에이전트 코드의 98.4%는 하네스다
Claude Code 유출 소스를 분석한 논문. 최소 스캐폴딩과 최대 하네스, 7겹 안전 레이어, 그리고 감독의 역설까지.
AI 하네스가 썩는 순간이 있다
모델이 바뀌어도 건드리지 않는 코어와 마음껏 깎는 어댑터. 이 경계가 무너지면 하네스는 썩는다. 6대 불변 원칙 정리.
AI 자동화에서 가장 어려운 설계가 뭘까?
에이전트 5개를 병렬로 돌리며 배운 것. 어디서 쓸 것인가보다 사람이 어디서 끼어들지가 더 어렵고 중요하다.
LLM은 영상을 보지 않는다. 읽는다
3만 프레임 영상을 12KB 트랜스크립트로 납작하게. browser-use 팀의 일관된 문법, 픽셀이 아니라 표현을 줘라.
프레임워크를 전부 지운 592줄, self-healing 브라우저 하네스
부족한 도구를 에이전트가 helpers.py에 직접 써 넣는 자가 치유 구조. 592줄이 1만 줄 프레임워크에 던진 질문.
혼자서 게임 만들 때 Claude한테 전부 시키면 어떻게 되냐고?
49개 에이전트를 3단계 계층으로 나눈 Claude Code 게임 스튜디오. 12개 hook과 11개 rule이 혼자 개발의 빈틈을 잡는다.
에이전트 규칙, "하지 마"보다 "이렇게 해"가 먹힌다
'접근 불가'라는 규칙이 AI의 판단을 꺾어 7번 연속 실패. 구체적 실행 방법으로 바꿔주자 한 번에 성공했다.
AI 코드 리뷰의 핵심, Fork와 Fresh Eye
같은 세션의 AI는 자기 코드에 방어적 판정을 내린다. 컨텍스트 보존은 Fork로, 격리는 Fresh Eye로 푸는 리뷰 시스템 설계.
--fork-session이 엉뚱한 대화를 가져오는 이유
JSONL은 세션이 끝나야 디스크에 쓰인다. --fork-session과 /fork의 문서에 없는 동작 차이를 추적해 이슈로 남긴 기록.
커밋 후 /simplify, 프롬프트 체이닝 한 줄이면 끝
병렬 세션을 돌리면 사소한 2턴이 인지능력을 갉아먹는다. 한 턴에 명령을 엮는 체이닝으로 순서 보장과 대기 시간을 동시에 잡는 법.
AI가 짠 코드, 왜 리뷰하면 항상 뭔가 아쉬울까?
AI는 팀의 기준과 설계 의도를 모른다. code-convention과 ADR을 먹이고, sub agent와 fork를 컨텍스트 기준으로 갈라 쓰는 리뷰 워크플로우.
/simplify + /loop = 자동 코드 검수
플러그인 0개, 스킬 0개. 네이티브 커맨드 두 개 조합으로 개선점 0이 될 때까지 알아서 반복 리팩토링. 걸린 시간 5분 5초.
.claude/ 권한 버그, PermissionRequest hook으로 뚫는 법
문서와 코드가 다른 권한 버그를 코드 레벨로 추적, hook 자동 승인 워크어라운드를 테스트 20개로 검증하고 이슈에 남겼다.