メインコンテンツへスキップ
For Schools / Cram Schools

AIモデルの選択が、採点の厳しさを決める。

gpt-4o ベースのAI採点ツールは、同じ採点指示を出しても中品質答案を約9-10点甘く評価します (当社実測 d=3.62)。EssAIは教育用途で Gemini を採用、入試本番に近い厳しい評価を提供します。

無料トライアル (2週間) →検証データを見る資料請求

Issues

塾長が抱える、3つの課題

⚖️

採点者依存のスコアブレ

同じ答案でも採点者によってスコアが揺れる。生徒の実力を客観的に把握しづらく、保護者への説明も難しい。

⏱

教師の採点工数が膨大

月100生徒の小論文採点には塾長工数 5-8時間/月 が発生 (当社想定値)。本来は指導や教材改善に使いたい時間が、採点で消費される。

📊

保護者への合格率説明が難しい

「うちの子は大丈夫?」という保護者の不安に、定量的な根拠で応えたい。AI採点が甘いと、本番との乖離が問題になる。

Technical Insight

AIモデル選択が、採点を変える。

当社検証で、同じ採点プロンプトでも Gemini と gpt-4o では中品質答案で約10点の差が発生することが判明しました (n=36, Cohen's d=3.62)。既存のAI採点ツールが gpt-4o ベース (Azure OpenAI Service 等) なら、生徒は甘く評価される可能性があります。

📊実測差・中品質答案

+9.75pt

系統S (Gemini + SHORONプロンプト) vs 系統F (gpt-4o + 同プロンプト)
プロンプト固定、モデル差のみで観測される差

Design

EssAIの3つの技術設計

🧪

教育用途で Gemini を選択

同じ採点プロンプトでも、Gemini と gpt-4o では中品質答案で約10点の差が発生 (実測 d=3.62)。EssAIは教育用途で Gemini を採用し、入試本番に近い厳しい評価を実現します。

🔁

2回サンプリング+平均化

本番採点フローでは2回並列サンプリング+平均化を行い、差分が大きい場合は3回目+中央値で補正。同一答案30回採点での総合σ ≤ 2.14pt (※採点ブレは答案によって両者で逆転するため、訴求軸としては使用していません)。

📐

5軸独立評価ルーブリック

論理構成・根拠・表現力・課題適合性・独自性の5軸で独立採点。各軸ごとの具体的な改善点を提示し、講師が指導の優先順位を判断できます。

実測データで実証

AIモデル選択が、採点の厳しさを決める。

gpt-4o ベースのAI採点ツールは、同じ採点指示を出しても中品質答案を約 9-10点甘く評価します (当社実測 d=3.62)。EssAIは教育用途で Gemini を採用し、 入試本番に近い厳しい評価を提供します。観測差の主因は 基盤モデル選択であることを実証しました。

⚠️

中品質答案

+12.83pt

ChatGPT素朴採点 vs EssAI
Cohen's d = 3.78, p < 0.001

🔬

モデル差の主因

+9.75pt

同プロンプトでも Gemini vs gpt-4o の差
Cohen's d = 3.62

📈

相関係数

r = 0.928

順位は同等、絶対値が信頼できない
n = 36 試行

🔬 検証プロトコル

規模

4お題 × 3品質 × 3系統 = n=36

系統S

EssAI本番 (Gemini)

系統F

SHORON同プロンプト + gpt-4o

系統P

ChatGPT 素朴プロンプト (gpt-4o)

4お題×3品質×3系統 の総合スコア分布
図1: 4お題 × 3品質 × 3系統 の総合スコア分布 (n=36)
答案品質ごとの3系統平均比較 (基盤モデル交絡の切り分け)
図2: 答案品質ごとの3系統平均比較 ── Gemini と gpt-4o の差が観測差の主因

🔍 検証データ完全公開

検証プロトコル・生データ (CSV)・分析スクリプトを開示請求できます。第三者機関・研究者による再検証を歓迎します。
sakumon2026@gmail.com →

  • 2026年4月 当社実測 (n=36 試行)。Welchのt検定で中品質 p<0.001、低品質 p<0.01。Cohen's d = 1.22〜3.78 (教育研究で「大」効果量レベル)。
  • 答案サンプルは Claude が生成 (実際の受験生答案ではない)。品質バリエーションは意図的に設計。
  • 採点ブレ (σ) は答案により両者で逆転するケースがあるため、訴求軸として使用していません。
  • 人間講師との比較は今後の追加検証で実施予定。
未来問の品質を実測検証
🎯

スキル要求一致度

8.37/10

志望校の要求する思考スキルとの一致度

8 点以上 88.2% ・ 5 点以上 100%

📚

教育的妥当性

100%

全 trial で実用合格水準 (5 点以上) を達成

skill_match 平均 8.37 / 10

📊

5 観点総合

88.2%

skill_match で 8 点以上を達成した trial 比率

n = 17 trial ・ Claude Sonnet 盲検評価

📐 5 観点別の実測スコア

スキル要求一致度

8.37 / 10

8 点以上 88.2% ・ 5 点以上 100%

出題形式一致度

8.02 / 10

8 点以上 70.6% ・ 5 点以上 100%

教育的妥当性

7.86 / 10

8 点以上 64.7% ・ 5 点以上 100%

難易度妥当性

7.42 / 10

8 点以上 12.5% ・ 5 点以上 100%

多様性 (3問が互いに異なる)

6.76 / 10

8 点以上 23.5% ・ 5 点以上 100%

🔬 検証プロトコル

規模

6 学校 × 3 trial × 5 観点 = 90 評価

素材

公式公開された実際の過去問(3〜4 年分 × 6 校)

生成

EssAI未来問 (Gemini Flash)

評価

第三者AIによる盲検評価(Claude Sonnet)

検証対象

早稲田大学政治経済学部 / 慶應義塾大学SFC / 東京大学 文学部・法学部・教養学部 (学校推薦型) / 国家公務員総合職

🔍 検証データ・改善ループの透明性

初版検証 (skill_match 4.29) から第三者AI評価を踏まえたプロンプト改善を繰り返し、 v9 で skill_match 8.37 / 10、88.2% で 8 点以上を達成。 検証スクリプト・サンプル・改善履歴は開示請求できます。

sakumon2026@gmail.com →

  • 「的中率」表記は使用していません。実際の入試の予想は1年後でないと検証できないため、 上記は生成時点で測定可能な品質指標 (スキル要求一致度・教育的妥当性・多様性・難易度妥当性・出題形式一致度) です。
  • 実際の過去問テキストは大学公式サイトの著作権配慮のため非公開ですが、 検証スクリプト・集計スコアは開示請求できます。
  • 改善余地が大きいのは難易度妥当性(8点以上12.5%)と多様性(同23.5%)で、 現在の重点課題です。難易度は過去問と同水準を下限とするよう生成条件を修正しましたが、 効果はまだ測り直せていません。
  • 出題形式一致度(8点以上70.6%)で落ちる主因は、 東京大学法学部 学校推薦型のグループディスカッション形式が AI 単独生成では完全再現が難しいため。改善は継続課題。
  • 難易度はユーザー入力ではなく、過去問群から AI が自動キャリブレーションします (estimated_difficulty_level)。

Operational Comparison

運用工数比較 ── 月100生徒シナリオ

工程ChatGPT 手動EssAI
採点プロンプト準備毎回手動貼付不要 (最適化済)
100名分の貼付・実行200分0分
結果整形・記録100-300分0分 (自動)
生徒への送付100分0分 (自動)
履歴管理・成長可視化手動Excel自動ダッシュボード
採点にかかる工数5-8時間/月0分

塾長の時給を ¥3,000 と仮定すると、年間 ¥180,000〜¥288,000相当 の人件費削減 (想定値)。 さらに、削減した時間を本来の指導や教材改善に振り向けることができます。

※ 上記工数は想定値です。実際の運用で増減する可能性があります。

Features

B2B 専用機能

🏫

教室管理ダッシュボード

生徒一覧・採点履歴・成長推移を一画面で確認。複数講師のアカウント管理にも対応。

🔗

生徒招待・進捗可視化

参加コードを配るか、名簿に登録して招待リンクを送るだけ。フェーズ別の成長曲線を可視化し、指導方針を素早く判断。

🎯

5軸別の弱点分析

生徒ごとに「論理構成が弱い」「独自性が安定して高い」など、軸別の強み・弱みを自動分析。

Pricing

料金プラン

教師プラン (¥4,980/月・生徒30名)、教室プラン (¥14,800/月・生徒100名)、プロプラン (応相談)

料金プラン詳細を見る →

Onboarding

導入フロー

STEP 01

無料トライアル

2週間・全機能

STEP 02

ROI試算

貴塾の生徒数で工数削減効果を試算

STEP 03

契約・導入

参加コードか招待リンクで生徒登録1分

STEP 04

運用サポート

メールサポート・優先対応

FAQ

よくあるご質問

Q.既に学校でAI採点ツール (Azure OpenAI ベース等) を導入しています。▼

多くの既存ツールは Azure OpenAI Service (gpt-4o) を採用しています。当社実測では、gpt-4o ベースのツールは標準的な採点指示でも中品質答案を9-10pt甘く評価する傾向があります (n=36, d=3.62)。生徒が「合格圏内」と表示されても、入試本番との評価ギャップが発生する可能性があります。EssAIは教育用途で Gemini を採用しているため、本番に近い評価を実現します。既存ツールとの併用導入も可能です。

Q.ChatGPT で生徒に採点させれば十分では?▼

当社検証で、ChatGPT素朴採点は中品質答案を約13点甘く評価します (Cohen's d=3.78, p<0.001)。また、月100生徒の手動運用には塾長工数 5-8時間/月 が発生します (想定値)。EssAIは同じ運用を 0分 で完了します。

Q.赤本AI とどう違うのですか?▼

赤本AI (教学社×みんがく) は、書籍に収録された問題に対するAI診断ツールです。EssAIは Web プラットフォームで、生徒自身が志望校の過去問を入力して未来問演習ができます。赤本AI で基礎を固め、EssAIで志望校特化の演習に進むという併用も可能です。

Q.AI採点の精度はどれくらい確かですか?▼

EssAI本番フローの採点再現性は σ≤2.14pt (100点満点中、同一答案30回採点)、5軸個別では σ≤1.17pt です。検証プロトコル・生データ・スクリプトを全て公開しており、第三者機関・研究者による再検証を歓迎します (sakumon2026@gmail.com)。

Q.未来問の検証規模 (n=17) は少なくないですか?▼

ご指摘の通りパイロット規模です。2027年度内に n=50+ への拡張検証を予定しており、データの濃い 3 校追加・各校 5-7 trial に拡張します。現時点でも (1) 思考スキル一致度 8.37 / 10、(2) 全 17 試行で 5 点以上を達成、(3) 当社採点モデル (Gemini) と独立した第三者AI (Claude Sonnet) による盲検評価で自社バイアスを排除、という事実は確認できています。検証スクリプト・生データは開示請求対応です。今後、人間講師との相関係数測定 (r > 0.7 を目標) も予定しています。

Q.無料トライアルはありますか?▼

はい、2週間の無料トライアルをご用意しています。教師プラン・教室プランどちらでも、契約前に全機能をお試しいただけます。

Q.導入後のサポートは?▼

教師プラン・教室プランともにメールサポート対応です。教室プラン以上は優先サポート対象。100名以上の大規模導入は個別ご相談をお受けします。

まず2週間、無料で試す。

全機能をお試しいただけます。クレジットカード不要、契約義務なし。

無料トライアルを始める →資料請求・お問い合わせ
© 2026 EssAI. 採点検証データは 開示請求 で公開しています。