メインコンテンツへスキップ
EssAI

小論文も、

医学部小論文AO・総合型選抜上智・青学の記述式早稲田政経・総合問題早稲田社学・総合問題慶應SFC・総合政策

クレジットカード不要 · 登録1分 · 毎月3回まで無料

iPhone・iPad アプリ(無料)を App Store で見る
5軸
採点指標
約30秒
で採点完了
4段階
習熟度で解説量が変化
±1〜2点
同じ答案を30回採点したブレ

学部独自「総合問題」入試の対策はこちら →

未来問の品質を実測検証
🎯

スキル要求一致度

8.37/10

志望校の要求する思考スキルとの一致度

8 点以上 88.2% ・ 5 点以上 100%

📚

教育的妥当性

100%

全 trial で実用合格水準 (5 点以上) を達成

skill_match 平均 8.37 / 10

📊

5 観点総合

88.2%

skill_match で 8 点以上を達成した trial 比率

n = 17 trial ・ Claude Sonnet 盲検評価

📐 5 観点別の実測スコア

スキル要求一致度

8.37 / 10

8 点以上 88.2% ・ 5 点以上 100%

出題形式一致度

8.02 / 10

8 点以上 70.6% ・ 5 点以上 100%

教育的妥当性

7.86 / 10

8 点以上 64.7% ・ 5 点以上 100%

難易度妥当性

7.42 / 10

8 点以上 12.5% ・ 5 点以上 100%

多様性 (3問が互いに異なる)

6.76 / 10

8 点以上 23.5% ・ 5 点以上 100%

🔬 検証プロトコル

規模

6 学校 × 3 trial × 5 観点 = 90 評価

素材

公式公開された実際の過去問(3〜4 年分 × 6 校)

生成

EssAI未来問 (Gemini Flash)

評価

第三者AIによる盲検評価(Claude Sonnet)

検証対象

早稲田大学政治経済学部 / 慶應義塾大学SFC / 東京大学 文学部・法学部・教養学部 (学校推薦型) / 国家公務員総合職

🔍 検証データ・改善ループの透明性

初版検証 (skill_match 4.29) から第三者AI評価を踏まえたプロンプト改善を繰り返し、 v9 で skill_match 8.37 / 10、88.2% で 8 点以上を達成。 検証スクリプト・サンプル・改善履歴は開示請求できます。

sakumon2026@gmail.com →

  • 「的中率」表記は使用していません。実際の入試の予想は1年後でないと検証できないため、 上記は生成時点で測定可能な品質指標 (スキル要求一致度・教育的妥当性・多様性・難易度妥当性・出題形式一致度) です。
  • 実際の過去問テキストは大学公式サイトの著作権配慮のため非公開ですが、 検証スクリプト・集計スコアは開示請求できます。
  • 改善余地が大きいのは難易度妥当性(8点以上12.5%)と多様性(同23.5%)で、 現在の重点課題です。難易度は過去問と同水準を下限とするよう生成条件を修正しましたが、 効果はまだ測り直せていません。
  • 出題形式一致度(8点以上70.6%)で落ちる主因は、 東京大学法学部 学校推薦型のグループディスカッション形式が AI 単独生成では完全再現が難しいため。改善は継続課題。
  • 難易度はユーザー入力ではなく、過去問群から AI が自動キャリブレーションします (estimated_difficulty_level)。
K

慶應SFC志望

高校3年生 · 総合型選抜

M

医学部志望

高校3年生 · 医学部小論文

T

東大学校推薦型志望

高校2年生 · 学校推薦型選抜

W

早稲田・政治経済志望

高校3年生 · 総合型選抜

N

看護学部志望

高校3年生 · 看護・医療系

C

地方公務員志望

大学3年生 · 公務員論文

開発者より

— 開発者 / 早稲田大学政治経済学部

実測データで実証

ChatGPTで採点すると、答案が約13点甘く採点される。

汎用AI (ChatGPT) と教育特化AI (EssAI) で同じ小論文を採点した結果、 中・低品質の答案で ChatGPTは平均 +12〜13pt 甘く採点する傾向が、統計的に有意 (p<0.001) であることが判明しました。

⚠️

中品質答案

+12.83pt

ChatGPT素朴採点 vs EssAI
Cohen's d = 3.78, p < 0.001

🔬

モデル差の主因

+9.75pt

同プロンプトでも Gemini vs gpt-4o の差
Cohen's d = 3.62

📈

相関係数

r = 0.928

順位は同等、絶対値が信頼できない
n = 36 試行

🔬 検証プロトコル

規模

4お題 × 3品質 × 3系統 = n=36

系統S

EssAI本番 (Gemini)

系統F

SHORON同プロンプト + gpt-4o

系統P

ChatGPT 素朴プロンプト (gpt-4o)

4お題×3品質×3系統 の総合スコア分布
図1: 4お題 × 3品質 × 3系統 の総合スコア分布 (n=36)
答案品質ごとの3系統平均比較 (基盤モデル交絡の切り分け)
図2: 答案品質ごとの3系統平均比較 ── Gemini と gpt-4o の差が観測差の主因

🔍 検証データ完全公開

検証プロトコル・生データ (CSV)・分析スクリプトを開示請求できます。第三者機関・研究者による再検証を歓迎します。
sakumon2026@gmail.com →

  • 2026年4月 当社実測 (n=36 試行)。Welchのt検定で中品質 p<0.001、低品質 p<0.01。Cohen's d = 1.22〜3.78 (教育研究で「大」効果量レベル)。
  • 答案サンプルは Claude が生成 (実際の受験生答案ではない)。品質バリエーションは意図的に設計。
  • 採点ブレ (σ) は答案により両者で逆転するケースがあるため、訴求軸として使用していません。
  • 人間講師との比較は今後の追加検証で実施予定。

フリー

¥0

月3回採点・全機能

POPULAR

シーズンパス

¥3,800/3ヶ月

無制限採点・3ヶ月ごとに自動更新

スタンダード

¥1,480/月

まず1ヶ月だけ・無制限採点

よくあるご質問

Q.総合問題は受けません。小論文だけでも使えますか?▼

はい。採点・批判的対話・模範答案・習熟度に応じた解説は、すべて小論文だけで完結します。総合問題向けの機能(出題型の判定・未来問)は使わなくて構いません。医学部・AO・学校推薦型の小論文で使っている方が中心です。

Q.ChatGPTで採点してもらえば十分ではないですか?▼

当社実測で、ChatGPT (gpt-4o) に「100点で5軸採点して」と依頼した場合、中品質答案を平均 +12.83pt 甘く採点する傾向が判明しています (Cohen's d=3.78, p<0.001)。「ChatGPTで75点」が、EssAIでは62点相当になることがあります。入試本番に近い厳しさで採点したいなら、教育特化のEssAIをご利用ください。

Q.採点の信頼性はどのくらいですか?▼

4お題×3品質×3系統=n=36試行で検証しています。検証プロトコル・生データ (CSV)・統計分析スクリプトをすべて開示請求できます (sakumon2026@gmail.com)。第三者機関・研究者による再検証を歓迎します。

Q.未来問は本当に志望校の傾向を捉えられているのですか?▼

早稲田政経・東大推薦・慶應SFC・国家公務員総合職など公式公開された実際の過去問 6 学校セットで検証しました。当社採点モデル (Gemini) と独立した第三者AI (Claude Sonnet) による盲検評価で、「志望校が要求する思考スキルとの一致度 (skill_match)」が平均 8.37 / 10、88.2% の問題で 8 点以上を達成、全 trial で実用水準 (5 点以上) を達成しています (n=17 trial)。「テーマの予想」ではなく「思考スキルの再現」を品質指標としているため、過去問で問われていないテーマでも、その大学が求める思考の型を確実に訓練できます。

Q.検証規模が n=17 と少なくないですか?▼

ご指摘の通り現在の検証はパイロット規模です。2027年度内に n=50+ への拡張検証を予定しており、データの濃い 3 校追加・各校 5-7 trial へ拡張します。現時点でも (1) skill_match 8.37 / 10、(2) 全 17 試行で 5 点以上を達成、(3) 当社採点モデル (Gemini) と独立した第三者AI (Claude Sonnet) による盲検評価で自社バイアスを排除、という事実は確認できています。詳細な検証スクリプト・生データは開示請求対応です。

Q.無料プランでどこまで使えますか?▼

月3回まで全機能 (5軸採点・批判的対話・知識フィードバック・未来問演習) が使えます。クレジットカード登録は不要、登録1分で開始できます。

Q.志望校の過去問は写真でアップロードできますか?▼

はい、写真・PDF (最大50MB) でアップロード可能です。AIが自動でOCR読み取りし、大学・学部・年度も自動入力されます。

Q.スマートフォンだけで使えますか?▼

はい。iPhone・iPad は App Store の無料アプリ(EssAI)が使えます。ブラウザでも全機能が動くので、Android や PC からはそのままご利用ください。

保護者の方へ

「うちの子、AIに過大評価されていない?」への回答

ChatGPT等の汎用AIで採点すると、生徒のスコアが実態より12〜13点甘く出る傾向があります (当社実測 n=36)。 生徒が「75点取れた」と思っていても、本番採点基準では62点相当である場合があります。 EssAIは、受験現場に近い厳しい基準で採点します。 また、答案の代筆は一切行いません(代筆しません宣言)。

保護者向け資料を請求する →

設計の根拠

演習の第2工程
Graham, S., & Perin, D. (2007). Writing Next. Carnegie Corporation.
習熟フェーズに連動
Brown, A. L., & Day, J. D. (1983). Macrorules for Summarizing Texts. Journal of Verbal Learning and Verbal Behavior, 22, 1-16.
執筆前と採点後
Graham, S., & Perin, D. (2007). Writing Next. Carnegie Corporation.
執筆画面
De La Paz, S., & Graham, S. (2002). Explicitly Teaching Strategies, Skills, and Knowledge. Journal of Educational Psychology, 94(4), 687-698.
総合問題対策
OECD (2019). How does PISA define and measure reading literacy? PISA in Focus #101.

効果量をそのまま成果として約束しません。上記の効果量は英語圏の中高生を対象とした研究の値です。日本語の小論文で同じ数字が出る保証はありません。 また Writing Next の効果量一覧は報告書自身が「介入のメニューであって順位表ではない」と述べています。

日本語の作文指導には、英語圏に相当する規模のメタ分析が見つかりませんでした。 上記は枠組みを日本語の小論文に翻案したもので、 翻案の妥当性そのものは今後の検証課題です。

引用元・実装箇所の対応、および検証に使った資料は開示請求できます。 sakumon2026@gmail.com

私たちが目指すこと

奨学金小論サポート — 開発中 / Coming soon

本番で気づく前に、
今、実力を正確に。

月3回の採点が永続無料。クレジットカード不要で今すぐ始められます。

iPhone・iPad アプリ(無料)を App Store で見る

塾・予備校・個人指導の方は 法人プラン をご覧ください