ficus.life/仕事
目次▼
「不可」を「まだ」に変えた学校は、成績が上がったのか

「不可」を「まだ」に変えた学校は、成績が上がったのか

マインドセットが変わったと確認できた13の研究だけを集めると、成績への効果量は0.04で、ゼロと区別がつかなかった。リスクの高い生徒への効果は、研究者によって0.09から0.19まで割れている。どちらを採るかの前に、何を数えているのかを見る。

TOMOAKI··仕事

「Not Yet」と、13の研究

心理学者キャロル・ドゥエックは、1980年代の研究(レゲットとの1988年の論文など)で、同じ難問につまずいた子どもの反応が、二通りに分かれることを論じた。「自分には向いていない」と諦める子と、「まだやり方が分かっていないだけだ」と食らいつく子である。前者は知能を固定されたものと信じ(のちに硬直マインドセットと呼ばれる)、後者は伸ばせるものと信じていた(成長マインドセット)。

ドゥエックは2014年のTEDトークで、卒業に必要な科目に合格しなかった生徒に、不合格ではなく「Not Yet」という評価を付ける、シカゴの高校の話を紹介した。「まだ」は、知能は伸ばせるという考え方を、成績表に書いた言葉だ。その考え方を生徒に教えると、成績は動くのか。教室で試した研究は、いくつもある。

先に、数字を一つだけ見せておく。この種の介入のうち、生徒のマインドセットが実際に変わったと確認できた13の研究だけを集めると、成績への効果量は0.04だった。効果量とは、介入を受けた生徒と受けなかった生徒の差を、成績のばらつき(標準偏差)を単位にして表したもので、0.04は、標準偏差の4パーセントほどの差にあたる。信頼区間は−0.01から0.10。ゼロと区別がつかないが、ゼロだと言い切れる幅でもない。一方、成績が低いなど、リスクの高い生徒に限った推定は、研究者によって0.09から0.19まで割れている(対象の定義も、研究ごとに違う)。この記事は、その割れ方をたどる。

相関は.10にも、.27〜.34にも見える

マインドセットと学業成績の関連を疑う側が根拠にするのは、2018年に発表されたSiskらのメタ分析(多数の研究の結果を束ねて、全体の傾向を調べる手法)だ。273の効果量を束ね、参加者は36万5,915人にのぼる。統合した相関はr=.10、信頼区間は.08から.13だった。r=.10は、マインドセットの違いで、成績のばらつきのおよそ1パーセントが説明できる、という大きさにあたる。効果量の58パーセントは統計的にゼロと区別がつかず、6パーセントは逆向きで、有意に正だったのは37パーセントだった(丸めのため合計は100にならない)。成人に限れば、相関はほぼゼロ(r=.02)だった。

ドゥエックらが擁護側の立場でまとめた総説は、この数字の出し方に異議を唱える。カリフォルニア州の30万人規模の調査ではr=.27〜.28、チリの全国調査(16万8千人余り)ではr=.34で、これは成績のばらつきの約12パーセントにあたる。総説の紹介によれば、こうした大規模なデータと米国の全国実験だけで、メタ分析の全参加者データの81パーセントを占めていたのに、参加者が10人以下の相関(19件あった)とほぼ同じ重みで平均されているという。世論調査で言えば、10人に聞いた結果と30万人に聞いた結果を、どちらも「1件」と数えて平均を出している、という主張である。

1パーセントと12パーセント。その差が数え方だけで生まれるのなら、話は単純だ。ところが、重みを変えれば済む話でもない。大規模な調査は、特定の地域と時期のものにすぎず、そこでの相関が別の国や年齢にも当てはまる保証はない。そして、どのrも、介入で動かしたときの大きさを教えてはくれない。

15歳を対象にした国際学力調査、OECDのPISA(2018年調査、74か国・55万人超)では、72か国で成長マインドセットと得点のあいだに有意な正の相関があった。例外は中国とレバノンで、中国の小学5〜6年生433人の調査でも、有意な相関は出なかった。これは、擁護側の総説が自ら挙げている「支持しない証拠」の一つである。有意かどうかを数えているのであって、大きさの話ではない。差のどこまでが重みづけで、どこからが集団の違いなのかは、この総説からは切り分けられない。

教室の実験は、91人から1万2千人へ

相関では、因果は分からない。教室で試した実験のうち、初期の介入研究の一つが、ドゥエックらが2007年に発表したものだ(先行する介入研究として、アロンソンらの2002年の研究がある)。対象は、6年生の数学の成績が全国の35パーセンタイルだった、比較的成績の低い7年生で、79パーセントが無料給食の対象だった。週に1回、25分のワークショップが8週間続く。合計で200分、3時間少々だ。12〜14人ずつの既存のアドバイザリー学級が、無作為に二つの群に分けられた。

どちらの群も、脳の仕組みや勉強法を学んだ。違いは、実験群が「知能は伸ばせる」と教わり、統制群が記憶についての授業と、関心のある学業上の話題の話し合いを受けたことだけだ。成績の指標は、学期末の数学の成績(4点満点)である。残った91人(実験群48人、統制群43人)のうち、統制群の数学の成績は下降を続け、実験群の成績は、その下降が反転した、と報告されている。

その後、よく似た問いが、全国の高校で、別の形で試された。2015年度、米国の公立校65校(層化無作為抽出による全国代表標本)の9年生12,490人を、一人ずつ無作為に割り付ける実験が行われた(結果の論文は2019年)。介入は、1時間足らずのオンライン教材で「知能は伸ばせる」と伝えるもので、8週間続いた91人の教室とは、形がまるで違う。

事前に分析対象と決められていた、成績が低い側の生徒(約6,300人)では、GPAが対照群より0.10ポイント、標準偏差にして0.11高かった。

4.3点満点のGPAで、たとえば2.5の生徒が2.6になる、という大きさだ。

成績が高い側の生徒のGPAには、有意な効果がなかった(0.01ポイント)。この実験は、マインドセットが変わったかどうかも確認している。成績が低い側の生徒では、「知能は固定されている」という信念が、標準化して0.33下がっていた(5,650人)。信念の変化が成績の差を生んだのかを調べる媒介分析は、論文の本文には見当たらない。論文の著者らは、1時間足らずの低費用の介入が、厳密に評価された青年向けの介入のなかでも、最も効果的なものの効果の、かなりの割合に達した、と位置づけている。

数学の履修には、別の動きがあった。データのあった41校・6,690人で、10年生が代数II以上の数学を取る割合は、対照群の33パーセントから、介入群の36パーセントに増えた。3ポイントは小さく見えるが、割合にすれば1割近い増加だ。学校の成績水準との交互作用は有意で(P=.024)、成績が最上位の4分の1の学校で4ポイント、残りの学校で2ポイントの増加だった。GPAとは逆に、成績の高い学校ほど、効果が大きかった。

効果は学校によって揺れた。同じ論文は、周囲の生徒が難しい課題を選ぶ傾向、つまり学校の規範が強いほど、成績が低い側の生徒のGPAの効果が大きかったと報告している。規範は割り付けた要因ではないので、確かめられたのは、どの学校で試すかで結果の見え方が変わる、というところまでだ。

英国の101校では、読み書きと算数に上乗せが出なかった

学校単位で割り付けた実験は、英国にある。小学6年生5,018人・101校を対象にした、2019年の評価だ。1日の教師研修と、担任が自分のクラスで行う8週間の授業プログラムを、ひとまとまりの介入として、学校単位で無作為に割り付け、待機リストの学校と比べた。実施は2016年9月から2017年2月にかけてだった。

算数の効果量は−0.01(信頼区間−0.04〜0.01)で、読解と、文法・句読点・綴りも、ほぼ0だった。意欲や自己効力感といった、非認知的な4つの指標でも上乗せはなく、報告書の推定では、追加の進歩は0か月で、報告書は、この結論の確度を高いと評価している。計画時に想定していた、検出できる最小の効果量は0.20だったが、実測の級内相関で見積もり直すと、分析時点では0.11(検出力80パーセント)になっていた。

この数字を、全国実験の0.11と同じ問いへの答えとして並べることはできない。英国の結果は児童全体の平均で、全国実験の0.11は、成績が低い側だけの値だ。教科も、介入の形も違う。それでも、3教科とも信頼区間の上限が0.03以下であることは、全体に薄く効く、という筋書きには不利に働く。

同じ「知能は伸ばせる」でも、教え方は、8週間の教室、1時間足らずの画面、1日の研修と8週間の授業と、三者三様だ。何が効く部分で、何が飾りなのかは、これらの研究からは切り分けられない。

報告書は、理由の可能性として、待機側の学校の教師も、すでに成長マインドセットの考え方を知っていたことを挙げている。3分の1を超える教師が、関連する研修に出たことがあった。一方で、それを自分の授業で実際に使っていた教師は、少なかったとも補足している。

マインドセットが変わったと確認できた研究だけを集めると

Siskらの論文には、介入の効果だけを調べた第二のメタ分析(43件の効果量、参加者5万7,155人)がある。全体の効果量はd=0.08(信頼区間0.02〜0.14)で、幅が0をまたがないので、有意と呼ばれる。有意とは、偶然のばらつきだけでは説明しにくい、という意味だ。幅が0をまたぐ数字は、その研究が、ゼロとの違いを確かめられなかったことを意味する。著者らは、介入が「大きな成果」をもたらすという主張は、この結果からは支持できないと結論している。なお、前後の変化の差を計算できる情報は、研究の3分の1にしかなかったため、Siskらは事後の得点の標準化された差を使っている。この方法はバイアスを生みうる、と著者ら自身が断っている。

ある指導法の研究を想像してほしい。指導のあと、生徒が内容を理解できたかを小テストで確かめた研究と、確かめなかった研究がある。確かめなかった研究のほうが、成績の伸びは大きい。確かめた研究では、理解できた生徒の成績が、ほとんど伸びていない。確かめなかった研究の質が低かっただけ、という説明もありうる。マインドセットの研究にも、これと同じ形のデータがある。

Siskらの第二のメタ分析では、介入の前後でマインドセットが変わったかを測っていなかった15件(35パーセント)の効果量が、d=0.18だった。測っていた研究ではd=0.04で、この差は境界的に有意である。測っていた28件のうち、46パーセントは、前後の有意な変化が確認できなかった。そして、変化が確認できなかった研究(d=0.05)のほうが、確認できた研究(d=0.02)より、わずかに効果が大きかった。著者らは「最も意外」と書いている。ただし、この二つの差は、有意ではない。

同じ研究室のマクナマラとバーゴイン(Siskらの共著者でもある)は、2023年に、この問いを63研究(9万7,672人)で検証した。全体の効果量はd=0.05で、出版バイアスを補正すると有意でなくなる。96件の効果量のうち、介入群でマインドセットが有意に増えたと確認できたのは、4分の1の25件だった。24件は測ったが有意な変化がなく、47件は、検定の記載がないか、結果が載っていなかった。変化が確認できた13研究(1万8,355人)に限ると、成績への効果はd=0.04、信頼区間は−0.01から0.10だった。最も質の高い6研究に絞ると、d=0.02になる。

全国実験も、この63研究に入っている。ただし、成績の低い部分集団だけを報告した公表版ではなく、全生徒12,542人を含む未発表版が使われた。全国実験の0.11は、事前に決めた成績の低い約6,300人の値で、同じ範囲を測っているわけではない。

この結果の読み方には、注意が二つ要る。一つは、「変化が確認できた」という条件が、介入のあとで決まる条件だということだ。確認できなかったのは、本当に変わらなかったからかもしれず、尺度が粗かったからかもしれない。もう一つは、13研究のd=0.04は、信頼区間の上限が0.10に届くので、小さな効果を排除できたとは言えない、ということだ。逆の見方もある。自己報告の尺度は、教わった内容を答えられたかを測るにすぎず、尺度が動いたかどうかが、そのまま「効果の道筋」の有無を示すとは限らない。分かるのは、効果があったとしても、それがマインドセットの変化によるものだとは、いまのデータでは言えない、というところまでである。

ここで割れているのは、0.04という数字そのものではない。リスクの高い生徒に、効果が残るかどうかだ。Burnetteらのメタ分析(53の独立標本)は、標的を絞った部分集団で、かつ実施の忠実度が高い場合に、成績への効果がd=0.14(信頼区間0.06〜0.22)だったと報告した。Yeagerらを含むTiptonらは、マクナマラらのデータに同じ手法を当てはめ直し、リスクが高い群で0.15の有意な効果が残ると主張している。元の解析は研究ごとに効果量を一つにまとめるため、研究内のばらつきが失われ、効果の幅が狭く見積もられた、という指摘も添えている。

マクナマラらは、手法のほかに、効果量の差し替え、リスク区分の変更、別々の研究の同一扱いなどが行われており、63研究のうち22研究で情報が書き換えられていると反論した。Tipton側は、マクナマラらが平均しか入れておらず、Burnetteらが部分集団別に報告していた研究では、Burnetteらの推定値を使ったと(報告に確かな誤りがあった1件も同様に)説明し、品質の区分には、元のコーディングの誤りがあったと述べている。63研究のうち22研究が書き換えられたという側と、元のコーディングに誤りがあったという側が、同じ表の数字を、別々に読んでいる。

効きやすそうに見える生徒は、誰か

調整変数とは、効き方を左右する条件のことだ。Siskらの第二のメタ分析で、有意な調整変数になったのは、家庭の社会経済的地位だった。中流・上流の生徒ではd=0.03と効果がなかったのに対し、低所得の家庭の生徒ではd=0.34。ただし、その根拠は7件の効果量しかない。「学業的にリスクが高い」生徒のほうは、調整変数としては有意でなかった。一部の研究で、全標本の効果量を、リスクが高い部分標本の効果量に置き換えて分析し直すと、d=0.19と境界的に有意になる。Siskらでは、介入が授業に組み込まれたか、授業の外で行われたかでも、効果が違った(d=−0.14と0.09)。ただし、この差も、調整変数としては有意でない。

著者ら自身が、慎重に読むよう書いている。効果量の数が少なく、リスクが高い生徒とそうでない生徒の差は有意でなく、低所得の群の標本も小さい。マクナマラらの2023年の分析でも、変化が確認できた13研究の下位群のうち、課題の重い生徒(成績が低いなど)はd=0.09(信頼区間0.04〜0.14)と有意になる。ところが、課題の重さによる差も、社会経済的地位による差も、調整変数としては有意でなかった。

低所得の生徒に効くのか、成績の低い生徒に効くのか、どちらにも効くのか。数える人と、数え方によって、答えが変わる。

0.11は、大きいのか小さいのか

同じ0.11を、大きいと見るか小さいと見るかで、この論争は分かれる。Siskらは、教育介入の「典型的な効果量」として、ハッティらの1996年のメタ分析にある0.57を引いている。擁護側の総説によれば、そのメタ分析でも、追跡測定(多くは約108日後)では、効果が平均0.10まで下がっていた。0.57は、おおむね直後の測定の値だった、というのが総説の読みだ。

もう一つの物差しがある。クラフトが2020年に発表した報告は、標準化テストの成績を結果とする教育介入の無作為化比較試験747本、効果量1,942件を集めた。効果量の全体の中央値は0.10で、0.05未満を小、0.20以上を大とする目安を提案している。ところが、サンプルが2,000人を超える研究の中央値は0.03で、100人以下の研究の0.24とは、8倍の開きがある。この差の一部は、出版バイアスや、費用のかかる介入ほど小さな標本で試されやすいことによる、とクラフトは見ている。事前登録と結果の報告が義務づけられた米国教育省資金の試験(49本)に絞っても、中央値は0.03だった。クラフト自身は、大規模で事前登録された実地実験が幅広い学力指標を見たものなら、0.10や0.15でも大きく印象的な効果とみなしてよい、と結論している。

では、0.11は「大」なのか。そう言い切れない理由が二つある。目安は標準化テストを結果とする研究のもので、全国実験の結果はGPAだった。しかも0.11は、成績が低い側だけの値で、全体の効果は、それより小さくなる。事前登録が義務づけられた米国教育省資金の試験(49本)の中央値0.03と並べれば、0.11は3倍を超える。ただし、部分集団の値を、全体の中央値と並べているのだから、言えるのはそこまでだ。参考までに、効果量全体の中央値は0.10で、0.11はその近くにある。

提唱者自身が、実践の質に注文をつけている

ドゥエックは、2015年にEducation Weekへ寄せた文章で、数年前にオーストラリアの同僚スーザン・マッキーが「偽物の成長マインドセット」の流行に気づいた、と書いた。成長マインドセットがあると口にする教育者の言動が、実際には食い違っている、という指摘だ。

ドゥエックは別の例も挙げている。学んでいない生徒に、その場で気分を良くさせるために「よく頑張ったね」と声をかけるのは、よくない、というものだ。行き詰まった生徒には、これまで何を試し、次に何を試せるかを一緒に話す、とドゥエックは書いている。

この文章は、二通りに読める。実装が悪かったから効かなかった、という擁護にも、広まりすぎた看板の問題だ、という批判にも使える。実装の質を測る方法がない限り、この論点は、どちらの側にも決め手にならない。

恵まれない生徒に効くことと、格差を説明することは別だ

恵まれない生徒に効くという報告は、「マインドセット教育で、経済格差による学力差を埋められるのではないか」という期待も呼んだ。2025年に発表された、73か国のPISA2022データの分析は、その期待に慎重だ。家庭の社会経済的地位が学力に与える影響のうち、マインドセットの違いを通じて説明できる部分は、教科(数学、読解、科学)によって最大でも2.9〜3.2パーセントである。

これは横断データを統計的に分解した結果で、介入の実験ではない。それでも論文は、成長マインドセットが貧困の影響を和らげる、という考えへの疑問として、この結果を位置づけている。

「Not Yet」の学校の成績は、この記事では数えられなかった

この記事で見てきた食い違いは、どれも「何を数えているか」の違いに行き着く。相関では、どの調査に重みを置くか。実験では、全体を見るか、事前に決めた部分集団を見るか。操作チェックでは、変化を確認できた研究だけを数えるか、すべてを数えるか。

示せたのは、「知能は伸ばせる」と教える教室の研究までだ。相関は.10から.34まで幅があり、その差が重みづけによるのか、集団や測定の違いによるのかは、切り分けられなかった。全国実験は、事前に分析対象と決めていた成績の低い生徒に、GPAで0.11を残した。英国の101校では、児童全体に上乗せが見られなかった。変化が確認できた13研究の平均は0.04で、リスクの高い生徒に限った推定は、0.09から0.19まで割れている。どの生徒に効くのか。効いたとして、それはマインドセットが変わったからなのか。いまのデータでは、どちらも言えない。

「Not Yet」と書かれた成績表の向こうで、何人の生徒の点数が動いたのか。講演は、その学校の数字を見せなかった。この記事が数えられたのは、同じ考え方を教室で教えた研究の数字までだ。

出典

Dweck, C. S., & Leggett, E. L. (1988). "A Social-Cognitive Approach to Motivation and Personality." Psychological Review, 95(2), 256–273.
Dweck, C. S. (2014). "The Power of Believing That You Can Improve." TEDxNorrköping(2014年12月公開).
Sisk, V. F., Burgoyne, A. P., Sun, J., Butler, J. L., & Macnamara, B. N. (2018). "To What Extent and Under Which Circumstances Are Growth Mind-Sets Important to Academic Achievement? Two Meta-Analyses." Psychological Science, 29(4), 549–571.(原論文の全文で確認。Yeager & Dweck (2020) は統合相関を.09と引用しているが、原論文の値は.10である)
Yeager, D. S., & Dweck, C. S. (2020). "What Can Be Learned From Growth Mindset Controversies?" American Psychologist, 75(9), 1269–1284.(カリフォルニア州・チリ・PISA・中国の調査、データの81パーセント、およびハッティらのメタ分析の追跡測定の値は、この総説による紹介である。各調査の個別の原典は、本稿では確認していない)
Blackwell, L. S., Trzesniewski, K. H., & Dweck, C. S. (2007). "Implicit Theories of Intelligence Predict Achievement Across an Adolescent Transition: A Longitudinal Study and an Intervention." Child Development, 78(1), 246–263.
Aronson, J., Fried, C. B., & Good, C. (2002). "Reducing the Effects of Stereotype Threat on African American College Students by Shaping Theories of Intelligence." Journal of Experimental Social Psychology, 38(2), 113–125.
Yeager, D. S., et al. (2019). "A National Experiment Reveals Where a Growth Mindset Improves Achievement." Nature, 573, 364–369.
Foliano, F., Rolfe, H., Buzzeo, J., Runge, J., & Wilkinson, D. (2019). "Changing Mindsets: Effectiveness Trial — Evaluation Report." Education Endowment Foundation.
Macnamara, B. N., & Burgoyne, A. P. (2023). "Do Growth Mindset Interventions Impact Students' Academic Achievement? A Systematic Review and Meta-Analysis With Recommendations for Best Practices." Psychological Bulletin, 149(3–4), 133–173.
Burnette, J. L., et al. (2023). "A Systematic Review and Meta-Analysis of Growth Mindset Interventions: For Whom, How, and Why Might Such Interventions Work?" Psychological Bulletin, 149(3–4), 174–205.
Tipton, E., Bryan, C., Murray, J., McDaniel, M. A., Schneider, B., & Yeager, D. S. (2023). "Why Meta-Analyses of Growth Mindset and Other Interventions Should Follow Best Practices for Examining Heterogeneity: Commentary on Macnamara and Burgoyne (2023) and Burnette et al. (2023)." Psychological Bulletin, 149(3–4), 229–241.
Macnamara, B. N., & Burgoyne, A. P. (2023). "A Spotlight on Bias in the Growth Mindset Intervention Literature: A Reply to Commentaries That Contextualize the Discussion (Oyserman, 2023; Yan & Schuetze, 2023) and Illustrate the Conclusion (Tipton et al., 2023)." Psychological Bulletin, 149(3–4), 242–258.
Hattie, J., Biggs, J., & Purdie, N. (1996). "Effects of Learning Skills Interventions on Student Learning: A Meta-Analysis." Review of Educational Research, 66(2), 99–136.(0.57はSiskらの引用で確認。追跡測定の0.10は、原論文ではなくYeager & Dweck (2020) の紹介による)
Kraft, M. A. (2020). "Interpreting Effect Sizes of Education Interventions." Educational Researcher, 49(4), 241–253.
Dweck, C. S. (2015). "Carol Dweck Revisits the 'Growth Mindset'." Education Week, September 22, 2015.
Madia, J. E., Gruijters, R. J., Raabe, I. J., & Hübner, N. (2025). "Growth Mindset and Socioeconomic Inequality in Academic Achievement Across Seventy-Three PISA Countries." npj Science of Learning, 10, Article 81.