AIとの仕事の「うまさ」を、測る。
セッションログを1つ渡すだけ。指示の出し方から検証のしかたまで5つの評価項目を1〜5点で採点し、根拠になった記録と、直すと点が伸びる箇所を返します。3点が実務で通用する標準レベルです。
採点の対象は AI そのものではなく、AI を使う人の進め方です。採点基準に照らした5段階の絶対評価です。他のエンジニアとの比較(順位・偏差値)ではありません。総合スコアは各評価項目のスコアを重みで加重平均した値です。
使い方
- セッションログを選ぶ
- 内容を確かめ、「LLM採点を行う」にチェックして実行する
- スコアと根拠・行動タイムラインを見る
対応しているログは Claude Code のセッションログ(.jsonl)です。
評価項目
- 指示の質
- AIへの指示が明確で、必要な文脈・制約・完了条件を含んでいるか。タスクを適切な粒度に分解できているかも見ます。
- 検証行動
- AIの出力を鵜呑みにせず確認しているか。実行・テスト・実データでの動作確認や、AIの誤りを見抜いて指摘した場面を見ます。
- 自走の制御
- AIに任せる部分と自分で判断する部分の切り分けが適切か。危険な方向に進んだとき素早く割り込めているかも見ます。
- 効率
- 人間側の運転効率。同じ指示ミスの繰り返しや人間起因の手戻りが少ないかを見ます。AI側の迷走はこの項目の減点理由にしません。
- 成果
- セッションの目的に対する達成度と質。実際に動くもの・使えるものが出たかを見ます。生成物の量そのものは加点になりません。
送信されるもの
- 送信するのは採点する1ファイル
- 外部LLMへの送信はチェックを入れたとき
- 登録なしで使えます