本文へスキップ
メニュー
ワークフロースキル、tmux、毎日のループツールai-usagebar24のAIプロバイダーのクォータとリセット時刻ghpending未対応のプルリクエストとIssueを1つのリストにtclockコマンドウィジェット付きのターミナル時計ai-memoryコーディングエージェントの長期メモリai-jailAIコーディングエージェント用のOSサンドボックス執筆ブログとLLMベンチマークニュースレターThe M.Akita Chronicles、毎週月曜日ポッドキャストAIについての長い対談を動画でゲームコードで管理するゲームコレクション、Omarchyで環境Omarchy、tmux、そして見送ったものフォロー
執筆

AIについて学んだことを、すべて書き残す

2006年からブログを書いています。最近はほとんどがLLMとの仕事についてです。何がうまくいくか、いくらかかるか、何がマーケティングか。どの記事も英語とポルトガル語で公開しています。

LLMベンチマークv4

主要モデルをすべて、同じ妨害工作入りのアプリでテスト

v4は、7回のスプリントで育っていく1つのRailsアプリです。その間、隔離されたサブエージェントが実在のCVEをもとにした14個の妨害工作を仕込みます。モデルは注意深さで順位付けします。壊れているところに気づいて直したか。ここにたどり着くまでに、ベンチマークを一から作り直すのは3回目でした。

主要なフロンティアモデルが出るたびに、同じ表で走らせます。直近の回では2026年9月23日に5モデルを追加しました。どのモデルを何に使うか、タスクあたりいくらかかるかは、これで決めています。

44
順位付けしたモデル
14
見抜くべき妨害工作
7
1回の実行あたりのスプリント
$4,000+
9日間で使った金額
v4の結果のバブルチャート:横軸は対数目盛りのドル建てコスト、縦軸はスコア、バブルの大きさは実時間、色はハーネス。お得なものは左上に集まります。
実際のドル建てコストがあるTier Aモデルのコストとスコア。パート2より。左上ほどよく、バブルが小さいほど早く終わっています。

エージェントとの働き方

1人でこれだけのプロジェクトをメンテナンスするためのプロセス、スキル、安全網。

ここにあるものはすべてオープンソースです

ツールもスキルもベンチマークも公開リポジトリです。フォークして、自分の働き方に合うバージョンを作ってください。