이 발표 자료는 가로 화면(16:9)에 맞춰져 있습니다. 세로에서는 글자가 너무 작아져서, 가로로 돌리면 바로 첫 장이 나옵니다.
rotate your device to view
← → SPACE 빌드/이동 ·1–5Act ·N노트 ·F풀스크린
Act 1 · 기원
Act 2 · 규모
Act 3 · 파이프라인
Act 4 · 결과
Act 5 · 변화
EVOLVING WITH KARPATHY · 200TH RUN
200번의 자동 수확, 수확을 덜 믿는 시스템이 됐다
넉 달,211라운드, 반영535건— AI가 매일 읽으며 무엇을 모았고, 어떤 기준으로 걸렀고, 어떻게 달라졌나
HUE
1
ACT 01 / 05 · 기원
기원
Where It Came From
이 시스템은카파시에서 시작됐다. 개념의 뼈대를 준 AI 연구자, 게이트(강제 장치)까지 만든 조직, 볼륨을 지배한 커뮤니티 —세 축이 각각 다른 방식으로이 시스템을 키웠다.
축 1 · 이름과 뼈대
언급은가장 적고, 남긴 것은 가장 깊다
Andrej Karpathy
시스템의 이름이 그의 개념이다
자가개선 체계 전체를 부르는Loopy Era가 그의 말이고, 모든 수확을 채점하는 점수 축 이름조차loopy_era_score(그 이름을 딴 채점 축)다. 수정→측정→채택/폐기를 무한 반복하는 autoresearch 루프, 코딩 4원칙, 지식 인덱스 설계까지 뼈대가 그에게서 왔다.
14
언급
4
구조 이식
왜 깊이가 다른가
인용은 문장을 남기고, 구조는 시스템을 남긴다
다른 출처는 규칙안에근거로 들어간다. 카파시는 규칙을담는 그릇을 줬다 — 무엇을 점수라 부를지, 개선을 어떤 루프로 돌릴지, 지식을 어떻게 인덱싱할지.
Loopy Era — 체계 전체의 이름
autoresearch — 개선 루프의 형태
코딩 4원칙 — 판단의 기준선
LLM Wiki — 지식 인덱스 설계
축 2 · 문서를 넘어 강제까지
유일하게실행을 막는 장치까지 올라간 출처
Anthropic 공식
기명 출처 언급 1위
하네스(harness, AI 감시·강제 장치) 설계 블로그, Claude Code 팀 현장 가이드 — 사용자가 직접 골라 수확한 건도 있다.
77
언급
권고 → 강제
문서가 게이트가 됐다
대부분의 수확은문서(권고)로 끝난다. 이 출처만 실행을 실제로차단하는 장치가 됐다. 하네스 설계 글이 워크플로우 비용 게이트로 바뀐 것이다.
1
강제 게이트
차이의 의미
읽히는 규칙 vs 막는 규칙
문서는 무시할 수 있다. 게이트는 못 한다. 조건을 어기면 명령이 실행되지 않기 때문이다. 그 경계를 넘은 출처가 하나뿐이라는 사실이 채택 기준의 엄격함을 보여준다.
축 3 · 볼륨의 지배자
사람 이름 대신증거의 종류가 기준이 됐다
arXiv 연구 커뮤니티
규칙에 인용된 고유 논문 136편
7월 이후 수확의 사실상 표준 논문 출처다. 특정 저자보다“통제 실험이 있는 증거”라는 기준 자체가 채택 조건이 됐다.
136
고유 논문
66
근거 보강
출처의 질 — 계단식 상승
스타 수에서 실험 증거까지
4월 · GitHub 스타 수
낮음
5~6월 · 화제성
중간
7월 · 통제 실험
높음
반증 가능성이 인기를 밀어내고 채택 조건이 된 지점이다.
그 외 기명 영향(언급 수) — OpenAI Codex 팀 37 · addyosmani 17 · LangChain 13
2
ACT 02 / 05 · 규모
규모
By the Numbers
2026년 4월 6일 1차부터 7월 25일 211차까지넉 달. 아래 수치는 전부전수 파싱(전부 읽음)한 실측값이다. 추정도 반올림도 없다.
110일간의 실측
숫자로 보는211라운드
211
수확 라운드
535
반영 아이템
112
살아있는 규칙
136
인용 논문
293
지식 메모
140
강제 hook
7.74
평균 반영 점수 / 10
43
공백 일수
2.6
라운드당 반영
대상 — 공개 로그 카드 206장 · 지식 인덱스 · 규칙 파일 112개 전수 파싱(전부 읽음)
Timeline
넉 달의 리듬 —폭발, 침묵, 재편
4월 · 폭발기
79
5월 · 8일에 멈춤
31
6월 · 수확 공백
31
7월 · 재개 (~7/25)
70
P1 폭발기
1→110차 · 하루 4회 GitHub 레포 중심
P2 공백
수확 0 · 43일 사고 학습만 지속
P3 증류 개혁
7/3 지식 분리 컨텍스트 26만 절감
P4 논문 지배
하루 3회 재개 회당 50~60편
P5 절제
신규 추가 대신 기존 규칙 강화
공백의 역설
수확이0이던 달에 규칙이 가장 많이 생겼다
외부 수확
43일간 완전 정지
5월 8일 110차를 끝으로 6월 20일까지단 한 번의 수확도 없었다.
0
6월 수확
→
내부 학습
그런데 규칙은 46개 생겼다
외부 지식 대신실전 사고(버그 수정 커밋)에서 배우는 경로가 대신 돌았다.
46
6월 신설 규칙
여기서 분업이 처음 드러난다 — 논문은 관점을 주고, 사고는 게이트를 만든다. 뒤에서 다시 나온다.
3
ACT 03 / 05 · 파이프라인
파이프라인
Collect & Filter
무엇을 모으고 무엇으로 거르는가. 채널·필터·주기·상한이전부 설정 파일에 코드로박혀 있다. 그날의 기분은 못 끼어든다.
Input Channels
세 갈래의 신호,여섯 개의 채널
논문 — 학술 신호
arXiv + HuggingFace
AI·계산언어학·머신러닝·멀티에이전트4개 카테고리를 매일 최신순으로 스캔하고, HuggingFace(AI 모델 저장소)가 고르는 인기 논문을 함께 읽는다. 논문 번호로 두 채널 간 중복을 자동 제거한다.
50편/일
arXiv 스캔
15
주제어 필터
코드 — 커뮤니티 신호
GitHub 4경로
주간 트렌딩(전 언어 + 6개 언어별), 토픽 검색, 엄선 awesome 리스트(추천 모음집) 7종.코드가 없는 문서-전용 레포도 허용한다. 컨셉과 가이드도 신호라서다.
6+7
쿼리+리스트
★100+
최소 스타
사람 — 관점 신호
구루 스캔 + 블로그/HN(해커뉴스)
구루(유명 개발자) 9인의 GitHub을 직접 스캔한다. 최근 push 20개에★ 누른 레포 30개까지(만든 것뿐 아니라 주목한 것도 신호). 블로그 5피드와 해커뉴스 API(자동 조회)를 더한다.
9
구루 GitHub
20+30
push+star
구독 대상도 심사받는다
“누구를 볼지”조차사람이 그때그때 고르지 않는다
네 가지 필수 조건 다 만족(AND)
하나라도 못 넘으면 목록에서 빠진다
에이전트·자동화 생태계에실제 결과물보유
최근 90일 push3회 이상
공개 레포10개 이상— 단일 프로젝트 계정 제외
여러 채널에 겹치면주 활동처 한 곳만
2026년 4월 심사 결과
실제로 명단이 바뀌었다
활동 유형까지 심사해“레포를 계속 만드는 사람”만GitHub 스캔 대상에 남긴다.
글만 쓰는2인 → X 채널로 강등
비공개 소스1곳 → 완전 제거
현재 명단 — karpathy·Anthropic(가중치 10) · Simon Willison·nagix(9) · yoheinakajima·OpenAI(8) · LangChain·Matt Shumer(7)
Decision Funnel · 하루 수백 건 → 반영 2~3건
“좋아 보인다”는도입 사유가 아니다
①
중복 인덱스 — 본 것은 다시 안 본다
모든 항목의 지문(해시 값)을 영구 기록해 재등장을 차단한다
누적 7,100건+
②
5축 채점 — 10점 만점, 6점 미만 탈락
자동화 증대 · 마찰 제거 · 강제 전환 가능 · 토큰 효율 · 측정 가능 (각 0~2점)
통과 평균 7.74
③
실행성 판정 — 강제 가능하면 문서 금지
코드로 차단할 수 있는 원칙은 게이트로만. 규칙 문서로 대체 불가
“왜 죄다 룰만?”
④
신규성 판정 — 새로움의 등급
새 행동 변화만 새 규칙 · 정량 보강은 근거만 추가 · 재확인은 노트만
보강 36 : 신규 20
⑤
중복·예산 게이트
기존 규칙과 50% 이상 유사하면 병합 · 규칙 총량과 용량에 상한
114 / 120개
⑥
적용 전후 실측 비교
행동 지표가 안 오르면 폐기 —변화 없음도 폐기
개선 0 = 폐기
분석까지 살아남고도 절반 이상이 최종 탈락한다. 최근 92건 중 분석 64 vs 반영 28이다. 반영 후에도 끝이 아니다. 회귀(다시 나빠짐) 시 롤백(되돌리기), 90일간 안 쓰인 규칙은 삭제 후보다.
정직한 한계
채점은예측일 뿐 증명은 못 된다— 문서가 스스로 그렇게 적었다
한계 인정
5축 점수의 정체
“도입하면 좋아질 것”이라는예측일 뿐이다. 개별 규칙의 실측 개선치는 행동 지표가 거의 안 움직여 사실상 측정이 어렵다. 파이프라인 문서에 그렇게 명시돼 있다.
그래서 어떻게 하나
입구는 채점, 검증은 사후에
90일간 한 번도 발동 안 한 규칙은삭제 후보
독립 배치2회 이상 같은 방향증거만 승격 유지
자기가 만든 스킬이placebo(위약)였다는 논문(159차) 이후채택 기준 자체를 조였다
4
ACT 04 / 05 · 결과
결과
What Landed
200회 수확의 최대 관심사는 새 기능이 아니었다 —“AI의 주장을 어떻게 믿을 것인가”였다.
주제별 언급 빈도 · 아이템 제목 535건 + 지식 인덱스 285줄
1·2위가검증과 평가다
검증 / 게이트
94
평가 / 벤치마크
71
하네스 설계
60
스킬 / 플러그인
59
워크플로우 / 상태
56
메모리 / 지식
54
자가개선 / 진화
54
코드 인덱싱 / 검색
52
컨텍스트 관리 / 압축
46
멀티에이전트 조율
39
초록 = 1·2위. “믿음의 문제”가 새 기능·오케스트레이션(AI 조율)보다 위에 있다.
가장 많이 강화된 규칙 · 누적 근거 보강 66건
전부“자율 시스템의 자기기만 방지”계열이다
recursive-self-improvement-loop(자가개선 폐루프)
자가개선은 실행→분석→규칙화→청소의 폐루프(닫힌 순환)로. 산업 배포 실증부터 재귀 개선 논문까지 최다 보강