AI活用ログ診断

Claude Code のセッションログから、AIとの進め方の質を採点します

AIとの仕事の「うまさ」を、測る。

セッションログを1つ渡すだけ。指示の出し方から検証のしかたまで5つの評価項目を1〜5点で採点し、根拠になった記録と、直すと点が伸びる箇所を返します。3点が実務で通用する標準レベルです。

採点の対象は AI そのものではなく、AI を使う人の進め方です。採点基準に照らした5段階の絶対評価です。他のエンジニアとの比較(順位・偏差値)ではありません。総合スコアは各評価項目のスコアを重みで加重平均した値です。

使い方

  1. セッションログを選ぶ
  2. 内容を確かめ、「LLM採点を行う」にチェックして実行する
  3. スコアと根拠・行動タイムラインを見る

対応しているログは Claude Code のセッションログ(.jsonl)です。

評価項目

指示の質
AIへの指示が明確で、必要な文脈・制約・完了条件を含んでいるか。タスクを適切な粒度に分解できているかも見ます。
検証行動
AIの出力を鵜呑みにせず確認しているか。実行・テスト・実データでの動作確認や、AIの誤りを見抜いて指摘した場面を見ます。
自走の制御
AIに任せる部分と自分で判断する部分の切り分けが適切か。危険な方向に進んだとき素早く割り込めているかも見ます。
効率
人間側の運転効率。同じ指示ミスの繰り返しや人間起因の手戻りが少ないかを見ます。AI側の迷走はこの項目の減点理由にしません。
成果
セッションの目的に対する達成度と質。実際に動くもの・使えるものが出たかを見ます。生成物の量そのものは加点になりません。

送信されるもの

  • 送信するのは採点する1ファイル
  • 外部LLMへの送信はチェックを入れたとき
  • 登録なしで使えます