본문으로 건너뛰기
메뉴
워크플로스킬, tmux, 매일의 루프도구ai-usagebarAI 제공업체 24곳의 할당량과 초기화 시간ghpending열린 PR과 이슈를 한 목록에tclock명령어 위젯이 달린 터미널 시계ai-memory코딩 에이전트를 위한 장기 메모리ai-jailAI 코딩 에이전트를 위한 OS 샌드박스블로그와 LLM 벤치마크뉴스레터매주 월요일 The M.Akita Chronicles팟캐스트AI에 관한 긴 대화, 영상으로게임Omarchy 위에 코드로 관리하는 게임 컬렉션작업 환경Omarchy, tmux, 그리고 쓰지 않기로 한 것들팔로우

AI에 대해 배운 모든 것을 글로

2006년부터 블로그를 썼습니다. 요즘은 대부분 LLM과 일하는 이야기입니다. 무엇이 통하는지, 비용이 얼마인지, 무엇이 마케팅인지. 모든 글은 영어와 포르투갈어로 올립니다.

LLM 벤치마크 v4

주요 모델 전부, 같은 사보타주 앱으로 테스트

버전 4는 스프린트 일곱 번에 걸쳐 커지는 Rails 앱 하나이고, 그동안 격리된 서브에이전트가 실제 CVE를 바탕으로 사보타주 열네 개를 심습니다. 모델은 경계심으로 순위를 매깁니다. 망가진 것을 알아채고 고쳤는가? 여기까지 오려고 벤치마크를 세 번째로 처음부터 다시 만들었습니다.

주요 프런티어 모델이 나오면 같은 표로 돌립니다. 최근 라운드에서는 2026년 9월 23일에 모델 5개를 추가했습니다. 어떤 모델을 어디에 쓸지, 작업당 비용이 얼마인지 저는 이렇게 정합니다.

44
순위에 오른 모델
14
찾아내야 할 사보타주
7
실행당 스프린트
$4,000+
9일 동안 쓴 비용
v4 결과 버블 차트: 로그 가로축은 달러 비용, 세로축은 점수, 버블 크기는 실제 소요 시간, 색은 하네스입니다. 가장 좋은 선택은 왼쪽 위에 있습니다.
2부에서 가져온, 실제 달러 비용이 있는 Tier A 모델의 점수 대비 비용. 왼쪽 위일수록 좋고, 버블이 작을수록 빨리 끝났습니다.

에이전트와 일하는 방식

한 사람이 이만큼의 프로젝트를 관리할 수 있게 해 주는 프로세스, 스킬, 안전망.

여기 있는 건 전부 오픈 소스

도구, 스킬, 벤치마크 모두 공개 저장소입니다. 포크해서 자기 방식에 맞는 버전을 만드세요.