第 34 章
發展與教育心理學的應用
縱貫方法學誕生於發展的研究,而整個領域最難的測量問題至今仍住在那裡。一個在三年級被測量、又在八年級再被測量的兒童,是在一把「必須先被建構出來、才讀得出任何變化」的量尺 (scale) 上改變的;他一邊變老、一邊在年級 (grade) 上前進,同時又屬於一個「世界與下一個世代不同」的出生世代 (birth cohort);而他還經過了一間間會在紀錄上留下自己印記的教室與學校。本章是應用篇的第二章,把三個發展與教育的問題從頭到尾做完,而它的主軸是:在這個領域裡,測量的決定先於、而且限制住建模的決定,不是反過來跟在後面。第一個個案研究追蹤跨年級的學業成就 (achievement),並且做了一件在正式論文裡罕見的事:它把同一份資料由原始的多波合併 (merge) 一路帶到時間計量 (time metric) 的裁決、測量恆等性 (measurement invariance) 的示範、對廠商垂直量尺 (vertical scale) 的盤問、帶著機構巢套 (institutional nesting) 的成長模型 (growth model)、加速設計 (accelerated design) 所要求的世代收斂 (cohort convergence) 檢定,最後到政策的轉譯,並在每一步上攤開:一個由測驗出版商作出的量尺化 (scaling) 選擇,如何可以翻轉「差距是不是在擴大」的結論。第二個個案研究發展連鎖 (developmental cascade),並堅持已發表文獻慣常忘記的那份估計標的 (estimand) 紀律,把穩定的特質 (trait) 與一個傳統交叉延宕追蹤模型 (cross-lagged panel model) 默默混淆掉的個體內交易 (within-person transaction) 分開。第三個轉向認知老化 (cognitive aging) 與那種「以快的時間尺度取樣一個慢的歷程」的測量叢發設計 (measurement-burst design),檢驗老化文獻的招牌假設:個體內變異性 (within-person variability) 在平均數下降之前就先上升;而它是帶著短序列與選擇性流失 (selective attrition) 所要求的清醒去做這件事的。貫串全章的教訓是 Wohlwill 的那一句:描述變化不等於解釋發展,而兩者之間的距離,正是本章試著讓人看見的那片空間。
學習目標
讀完本章之後,你應該能夠:(1) 依一個發展的時間計量 (time metric)(年齡、年級、波次,或某個成熟歷程的時鐘)所服務的估計標的來選它,並為那個選擇辯護;(2) 分析一個加速的世代序列 (cohort-sequential) 設計,並檢定、而不是預設它的收斂假設;(3) 把機構巢套,包括兒童轉換學校所造成的交叉分類 (cross-classification),整合進成長模型;(4) 以消費者的深度盤問一把垂直量尺,認清一項成長結論可能取決於尺、不亞於取決於孩子;(5) 在把個體間 (between-person) 與個體內 (within-person) 成分分開的前提下估計發展連鎖,並抗拒交叉延宕追蹤模型的積習;(6) 分析測量叢發資料裡變異性的改變與動態 (dynamics) 的改變,而不只是水準 (level) 的改變;以及 (7) 在報告發展與教育的發現時,包括「學習月數 (months of learning)」這類轉譯,把假設說出來、不藏起來。
34.1 發展與教育的地形
關於發展與學校教育的問題落在少數幾個家族裡,而說出是哪一個家族是第一個分析動作,因為它同時決定了估計標的與供應工具的那一章。一項能力平均而言會不會改變、又循什麼形狀改變,是關於常態變化 (normative change) 的問題,由第 13 與 14 章的成長曲線模型 (growth-curve model) 回答。兒童在變化上會不會彼此不同、又是什麼預測了那份不同,是關於變化的個別差異 (individual differences in change) 的問題,由同一批模型在人的層次上讀出的隨機效果 (random effect) 回答。一個發展中的系統會不會帶動另一個,例如閱讀拉起後來的數學、或投入拉起後來的成就,是一個交易性 (transactional) 或連鎖的問題,由第 20 與 21 章的追蹤模型家族回答。教室、教師或學校會不會留下印記,是一個機構效果 (institutional effect) 的問題,由第 13 與 14 章的多層次模型 (multilevel model) 延伸到教育永遠會加諸的那份巢套來回答。而波動本身會不會就是現象,例如預告認知衰退的那份表現不一致 (performance inconsistency),是一個「變異性即構念 (variability as construct)」的問題,由第 7、16 與 25 章的密集縱貫 (intensive longitudinal) 與動態工具回答。圖 34.1 畫出這份對應,而表 34.1 連同估計標的與代表性文獻一起列出來。
註:每一個問題家族都通往本書中回答它的那一部分,估計標的優先。一項發展研究通常同時問好幾個,而分析的手藝是把對應的分析排序、讓每一步為下一步提供依據,那正是本章三個個案研究要示範的。
表 34.1 問題分類、估計標的、章次與領域代表文獻。
| 問題家族 | 估計標的 | 章次 | 代表文獻 |
|---|---|---|---|
| 常態變化 | 平均軌跡的形狀 | 13–14 | McArdle and Epstein (1987) |
| 個別差異 | 變化的變異數;預測變項 | 14 | Duncan and Duncan (2009) |
| 連鎖 | 個體內的交叉延宕 | 20–21 | Masten and Cicchetti (2010) |
| 機構效果 | 第二/三層的變異數 | 13–14 | Raudenbush and Bryk (2002) |
| 變異性即構念 | 個體內標準差的改變 | 7、16、25 | Ram and Gerstorf (2009) |
註:估計標的這一欄就是紀律。同一份發展資料經常同時支撐好幾個標的,而分析者的工作是在選模型之前先說出當下在追哪一個,因為同一份資料會以不同的設定回答不同的問題。
在這一切背後坐著這個領域的招牌困難:被測量的東西在被測量的過程中不會停著不動。一個構念 (construct) 可以在保持同一個構念的同時,跨發展改變它的行為表現,也就是第 3 章的異型連續性 (heterotypic continuity),因而恐懼在學步兒身上看起來是分離焦慮 (separation distress)、在青少年身上看起來是社交迴避 (social avoidance),而單一組指標 (indicator) 服務不了兩者。即使表現是穩定的,分數所報告的那把量尺,也必須先被證明在每個年齡上意義相同,年齡之間的差異才解讀得成變化、而不是測量的漂移 (measurement drift),那就是第 18 章的恆等性問題換到發展的範圍上。而在成就測驗這件事上尤其如此:學區 (school district,在美國是持有學生紀錄的地方教育主管機關,與臺灣的就學分發區不同) 交到分析者手上的分數,抵達時已經被轉換到一把垂直量尺上,那把尺的建構裡嵌著分析者沒有作出、而且往往看不見的假設。這個問題本章要花很多篇幅處理,因為那是測量與建模撞得最有後果的地方。三個時鐘讓困難疊加:在一般的設計裡,一個孩子的年齡、年級與出生世代是一起前進的,只有刻意打破它們共線性 (collinearity) 的設計才分得開,那就是第 2 章的年齡/時期/世代 (age-period-cohort) 難題穿上發展的衣服,還多帶一層微妙:在學校資料裡,入學的切分日期扮演一條迴歸不連續 (regression-discontinuity) 的界線,細心的分析者可以善加利用。
資料本身也帶著自己的現實。發展研究裡的同意 (consent) 是一條鏈而不是一次事件,家長同意要重新取得、兒童本人的允諾 (assent,與家長的同意 consent 有別) 隨著孩子成熟而加上去,而流失絕不隨機,因為離開研究的家庭與留下來的家庭有系統性的差異。學校紀錄必須跨年、跨那些本來就不是為了串接而建的行政系統串接起來,而孩子會轉學,於是「學生巢套在一所學校之內」那份整齊,讓位給「學生與他們前後就讀的幾所學校交叉分類」。像全國性縱貫研究那樣的大規模評量,以稀疏的測量時點換來代表性 (representativeness) 與垂直量尺;而實驗室的縱貫研究,以小而選擇性的樣本換來密集、刻畫清楚的測量;兩者之間的設計取捨在抽象層次上是解不開的,只有對著一個具體的估計標的才解得開。圖 34.2 把三個時鐘的問題畫成具體的樣子,把同一批模擬的成就紀錄放在波次、年級與年齡三個橫軸上,讓眼睛看見世代的對齊會隨著選了哪個時鐘而多麼不同。
註:achieve_accel 加速設計(三個世代分別由三、四、五年級進入)的世代平均數。放在波次軸上 (a),三個世代呈現為平行的曲線,而它們合起來涵蓋的年級跨距看不出來。放在年級軸上 (b),重疊的段落接成一條橫跨三到八年級的加速成長曲線,那正是這個設計要換來的對齊。放在年齡軸上 (c),同年級但不同年齡的孩子被攤開,各段不再重合,因為在這份資料裡成長是由學校教育、而不是由年齡驅動的。這張圖就是「依估計標的選時鐘」的論證本身。
34.2 個案研究 A:跨年級的學業成就成長
第一個個案研究拿一份加速的、巢套在學校之下的成就資料,把它帶過完整的「測量到政策」鏈條,因為那條鏈上正是這個領域的招牌決定被作出的地方,而看著它們依序被作出,比孤立地處理其中任何一個都更有價值。資料是模擬的 achieve_accel 紀錄:\(30\) 所學校裡的 \(1{,}200\) 名兒童,在四個年度波次上受測,分屬三個重疊的年級世代、合起來涵蓋三到八年級,帶著一個在潛在能力 (latent ability) 量尺上已知的減速成長歷程、植入的社經地位 (socioeconomic status) 對水準與成長率兩者的效果、讓年齡與年級脫鉤的入學年齡變異,以及一部分在波次之間轉學的兒童。因為真相由建構而已知,下面每一個估計值都可以對照它稽核 (audit),那正是一個模擬範例的教學目的,也是這裡把數字報到真實資料不會允許的精度的理由。
34.2.1 裁決時間計量
第一個實質決定是要建模哪一個時鐘,而那是一個關於估計標的的決定,不是關於模型配適 (model fit) 的決定。如果問題關乎學校教育的效果,年級是自然的量尺,因為年級標示的是教學 (instruction) 的暴露 (exposure);如果問題關乎成熟 (maturation),年齡才是自然的量尺;而兩者分歧的程度,恰恰等於同年級的兒童在年齡上不同的程度,那來自延後入學 (delayed entry)、為求年齡優勢而刻意延後一年入學 (redshirting) 與留級 (retention)。把同一個減速成長模型配適到年級量尺上的成就分數,還原出三年級每年級 \(25.1\) 個分數點的增益、對照植入的真值 \(25\),以及一個 \(-1.53\) 的負二次項 (quadratic term)、重現了那份減速;而配適在年齡量尺上,把線性增益衰減到每年 \(23.7\) 點,並且更能說明問題地,灌大了估計出來的兒童間成長率變異性,因為把一個由學校教育驅動的歷程對齊在年齡上,會把學校教育的訊號攤散到「孩子恰好坐在每個年級裡的那些年齡」上。在這份資料裡分歧是溫和的,因為年級之內的年齡分散是溫和的,年級內年齡標準差大約半年,而誠實的結論不是「一個量尺對、另一個錯」,而是:對一個學校教育的估計標的來說,年級是比較銳利的那把尺,而兩者之間的分歧會隨著留級與延後入學所引進的年齡異質性而擴大。表 34.2 依審查者會希望看到的方式記錄這個決定,包含估計標的、選定的量尺、檢視過的替代方案,以及兩者的調和。
表 34.2 時間計量的裁決:個案 A 的決策日誌。
| 項目 | 年級量尺 | 年齡量尺 |
|---|---|---|
| 服務的估計標的 | 學校教育(教學暴露)的效果 | 成熟的效果 |
| 線性增益 | 每年級 \(25.1\) 點(真值 \(25\)) | 每年 \(23.7\) 點(被衰減) |
| 形狀 | 減速(二次項 \(-1.53\)) | 減速,但比較平 |
| 斜率異質性 | 較小(訊號對齊) | 較大(訊號沒對齊) |
| 判定 | 學校教育估計標的的首選 | 成熟估計標的的首選 |
註:兩個量尺都配適過;選擇跟著估計標的走,不跟著配適統計量走。這裡的分歧溫和,因為年級內的年齡變異溫和,而它會隨留級或延後入學而變得尖銳。兩者都報告、並加以調和,是站得住腳的做法。
34.2.2 測量這一層:先恆等性,再談尺
在任何跨年級的分數差異被讀成成長之前,有兩個截然不同的測量問題必須先回答,而把它們混為一談是常見的錯誤。第一個是這份測量在每個年級上是不是以同樣的方式運作,也就是縱貫恆等性 (longitudinal invariance) 的問題。把一個縱貫因素模型 (factor model) 配適到最年輕世代四個波次上的六指標成就測量,並依序加上恆等性限制,形貌 (configural)、量尺 (metric) 與截距 (scalar) 三個恆等性模型都配適得幾乎完美,比較配適指標 (comparative fit index) 都是 \(1.000\),而量尺與截距兩步的比較配適指標改變量都是 \(0.000\),那正是「由建構植入的恆等性」該有的樣子,也因此許可了「把這個成就複合分數 (composite) 解讀成跨年級以一把尺測量一個構念」。第二個問題完全是另一回事,關乎所報告量尺本身的等距 (interval) 性質,而成就測驗文獻在這裡藏了一個多數消費者從不檢視的決定。
基礎概念 • 垂直連結的速寫
一把垂直量尺把不同年級的分數放到同一條連續線上,好讓一個三年級與一個八年級的分數可以比較、而它們的差可以被叫做成長。這個建構建立在跨相鄰年級施測的共同題目上:一道同時被四年級與五年級作答的題目連結起這兩個年級的校準 (calibration),而一連串這樣的連結 (linking),透過一個試題反應模型 (item-response model) 校準之後,把單一把量尺傳播到整個範圍。這套程序是有原則的,但它並不唯一。試題反應模型的選擇、連結的設計、用來錨定 (anchor) 量尺的母體,以及把接續各年級擺上去的方法,全都在最後的等距間隔上留下指紋,而不同的、各自站得住腳的選擇,會產生「在兒童的排序上一致、卻在增益的大小上不一致」的量尺。消費者的義務不是去建那把尺,而是去問廠商作了哪些選擇,並檢驗研究的結論撐不撐得過說得通的替代方案。Kolen and Brennan (2014) 是這方面的權威;而對分析者來說重點在於:一把垂直量尺是一項建構,不是一項測量,而成長是透過它被讀出來的。
後果就是本章的招牌片段,圖 34.3 把它變成具體的。拿那一個潛在成長歷程,讓它通過三種單調 (monotone) 的重新量尺化,每一種都是一把說得通的廠商量尺、在每個年級上都保住每個孩子的排序,平均成長的形狀卻起了質的變化:在等距忠實的線性量尺上,成長是減速的,標準化單位下的二次項為 \(-0.036\);在一把把上段拉開的凸型 (convex) 量尺上,同一份成長看起來在加速,二次項的正負號翻轉為 \(+0.034\);而在一把把上段壓縮的凹型 (concave) 量尺上,成長看起來走上高原,減速加深到 \(-0.067\)。這個翻轉不是一件數值上的奇聞,而是一件實質上的事,因為二次項的正負號恰恰是一位政策分析者會拿來論證「學習在中間年級變慢或變快」的那個量。對公平性 (equity) 研究更糟的是,「社經差距會不會隨年級擴大」的估計值在三把尺之間擺動了近七倍,由凹型量尺上標準化的社經乘年級交互作用 \(0.028\)、經過線性量尺上的 \(0.088\)、到凸型量尺上的 \(0.192\),於是同一批兒童會生出「差距只是勉強在擴大」或「差距在急速擴大」兩種故事,完全取決於一個由測驗出版商 (test publisher) 作出的量尺化選擇。表 34.3 列出這些假設、建構方式與敏感度的發現。
註:子圖 (a) 呈現同一組模擬潛在成長經過三種單調重新量尺化之後的母體平均數,每一條各自對自己的全距標準化,因此只比較形狀:凸型的廠商量尺把曲線壓到對角線之下(看起來像加速),凹型量尺把它推到對角線之上(看起來像高原),等距忠實的線性量尺居中。子圖 (b) 呈現每一把尺之下的社經乘年級交互作用,也就是差距擴大的估計值;它由 \(0.028\) 擺動到 \(0.192\),而沒有任何一個孩子在任何一個年級上換過名次。驅動結論的是尺,不是孩子。英文版此圖的檔名是 ch34_fig04_ruler.pdf,與印出來的圖號 \(34.3\) 不合,圖形腳本的區塊標題也跟著錯;見 EN-34-01。
表 34.3 垂直量尺化:假設、建構與敏感度。
| 量尺化 | 它假設了什麼 | 對結論的影響 |
|---|---|---|
| 線性(等距忠實) | 保住等距的潛在量尺 | 成長減速;差距擴大 \(0.088\) |
| 凸型(上段拉開) | 後來的增益算得比較重 | 看起來在加速;差距擴大 \(0.192\) |
| 凹型(上段壓縮) | 後來的增益算得比較輕 | 看起來走上高原;差距擴大 \(0.028\) |
註:三把尺都是同一個潛在成長歷程的單調變換,在每個年級上都保住每個孩子的名次。等距層次的結論,也就是減速的正負號與差距擴大的大小,則沒有被保住。只要一項成長主張在性質上是等距的,就應該報告它對量尺化的敏感度。
常見陷阱 • 年級當量分數與等距的主張
教育研究裡最常見的量尺化錯誤,是把一個年級當量 (grade-equivalent) 分數、或一個未經檢視的廠商量尺分數,當成帶著等距意義來用,然後去計算並比較增益,好像全距底端的一分等於頂端的一分。年級當量分數尤其棘手,因為它是由中位數表現定義的,而且表現得非線性,於是固定的年級當量單位在不同的位置代表不同分量的學習。補救之道不是放棄這些分數,而是說明量尺的來歷、在要作等距主張時優先選用有可辯護等距理由的量尺,並把成長結論放進替代量尺化裡跑一遍當作敏感度分析,正如圖 34.3 所做的。一項只在某一家廠商的量尺上成立的差距擴大發現,是一項關於那家廠商的發現,不是關於那些孩子的發現。
34.2.3 帶著機構巢套的成長
兒童巢套在學校之下,而在一個縱貫設計裡這份巢套並不乾淨,因為兒童會轉學。在這份資料裡,\(1{,}200\) 名兒童中有 \(180\) 名在某個波次換了學校,而問題是要模型化每個孩子的原就讀學校、忽略那次搬遷,還是要模型化每個時點上的當前學校,那會讓兒童與他前後就讀的幾所學校交叉分類。把成長模型兩種都配適一次,忽略流動的單一隸屬 (single-membership) 設定,給出 \(123.4\) 的學校間變異數 (variance) 與 \(7.21\) 的殘差 (residual) 標準差 (standard deviation);而把每個時點記到它實際所屬學校的交叉分類設定,把學校間變異數降到 \(88.9\)、殘差降到 \(7.00\),因為單一隸屬模型迫使一位轉學生搬遷之後的時點載到錯的學校上,並把那份錯配 (misfit) 吸收成灌大的變異數。這個教訓可以推廣:流動不是一件可以用整列刪除 (listwise deletion) 把轉學生丟掉來處理的麻煩,那樣做恰恰是在流動所標示的那份劣勢上作選擇;流動是一項要以交叉分類來模型化的結構特徵。圖 34.4 把這個結構畫出來。
註:多數兒童只讀一所學校,但一位轉學生的各個時點在不同波次上屬於不同的學校,使兒童與學校這兩個分組交叉。一個交叉分類的隨機效果模型 (cross-classified random-effects model) 把每個時點記到它實際所屬的學校;一個只用原就讀學校的單一隸屬模型,會因為把搬遷之後的時點壓到錯的單位上而灌大學校間變異數,這裡由 \(88.9\) 灌到 \(123.4\)。
34.2.4 加速設計的收斂檢定
一個加速設計把各自涵蓋年級範圍一部分的世代合併起來,對齊在年級上,以重建任何單一世代都沒有被追蹤過的一段跨距。這項重建唯有在各世代在它們共有的年級上共享同一個成長歷程時才有效,那是一項世代收斂的假設,而這個設計讓它變得可檢定、而不只是被假定。把世代主效果與世代乘年級交互作用加進成長模型、以概似比檢定 (likelihood-ratio test) 比較,得到不顯著的結果,\(p = .94\),因此在這份資料裡收斂假設成立,一如它被植入的樣子。方法上的重點是:那項假設不該憑信心預設,而該被檢視,因為在真實的教育資料裡,成就、課程 (curriculum) 或科技暴露上的世代間長期趨勢 (secular trend) 是常態而不是例外,而一次失敗的收斂檢定不是麻煩,而是一項關於世代效果的發現,而加速設計正好處在偵測得到它的獨特位置上。
34.2.5 預測變項、彈性與政策的轉譯
成長模型立好之後,軌跡的預測變項就讀得出來了。社經地位每一個標準差把三年級的水準抬高 \(12.2\) 點、把成長率抬高每年級 \(3.74\) 點,後者就是在上面的量尺盤問中、在等距忠實的量尺上活下來的那個差距擴大效果。一項彈性檢查防止我們把減速的二次式強加在資料想要別種形狀的地方:一個帶年級平滑項 (smooth) 的廣義加法模型 (generalized additive model) 回報有效自由度 (effective degrees of freedom) \(3.8\),而訊息準則 (information criterion) 並不偏好平滑項勝過參數化 (parametric) 的二次式,Akaike 準則的差是 \(2.5\)、偏向二次式,因此那條精簡 (parsimonious) 的減速曲線是足夠的,而那份非線性 (nonlinearity) 確實是二次的、不是多項式漏掉的什麼東西。圖 34.5 把整個個案組裝起來:接起來的減速成長、學校間的變異,以及在擴大的社經差距。
註:子圖 (a) 呈現世代接起來的平均成就與配適的減速二次曲線。子圖 (b) 呈現 \(30\) 條學校平均軌跡(灰)圍繞著總平均(橘紅),也就是多層次模型所切分的那份機構變異。子圖 (c) 呈現各社經三分位 (tertile) 在各年級的平均成就,差距在等距忠實的量尺上隨年級擴大,而讀者現在知道這個結論以那把尺為條件。英文版此圖的檔名是 ch34_fig03_caseA_master.pdf,與印出來的圖號 \(34.5\) 不合;見 EN-34-01。
最後一步是政策讀者會要的那項轉譯,也就是把一個效果表達成學習月數,而它必須連同它的危害一起做。把三年級的社經差距 \(12.2\) 點,除以大約 \(25\) 點的年平均增益、再乘上一個學年的九個月,就把差距換算成大約 \(4.4\) 個學習月;而每年 \(3.74\) 點的擴大則換算成每年大約多 \(1.3\) 個月。這項轉譯在溝通上很有力、在分析上很脆弱,因為它繼承了那把量尺的每一項假設,因而同一份差距若表達在凸型的廠商量尺上,會換算成一個不同而且更大的月數;也因為它除的那個平均增益本身在減速,因此在被描述的範圍內並不是常數。一個學習月數的數字,因此絕不該在沒有交代它所依據的量尺、也沒有交代「它是一種溝通裝置 (communicative device) 而不是一項測量」的但書之下被報告。表 34.4 收攏那些報告義務,而實務方塊處理這類研究所仰賴的學區資料的現實。
表 34.4 教育與發展研究的報告檢核表。
| 項目 | 該報告什麼 |
|---|---|
| 時間計量 | 建模的那個時鐘、它服務的估計標的,以及與替代方案的調和 |
| 恆等性 | 建立起來的恆等性層次,以及支持它的配適改變量證據 |
| 垂直量尺 | 量尺的來歷,以及成長結論對替代量尺的敏感度 |
| 巢套與流動 | 巢套結構,包括為轉學生所作的交叉分類 |
| 世代收斂 | 那項收斂檢定,不是一項假設 |
| 學習月數 | 它所依據的量尺,以及它作為溝通裝置的身分 |
註:這份檢核表把本章的主張編碼起來:在這個領域裡,測量的決定是可以報告的結果,不是前置作業。一項沒有交代量尺、時間計量與巢套的成長發現,還不到可以解讀的程度。
實務要點 • 實務:使用學區資料與檔案資料
學區的成就資料是靠著為會計、而不是為研究而建的行政識別碼 (administrative identifier) 跨年串接起來的,而分析者的第一項工作是一次有文件的合併 (documented merge),依第 5 章的資料來歷 (data provenance) 紀律,在配適任何模型之前先調和重複紀錄、學年中途的轉出入,以及識別碼的變更。像美國《家庭教育權利與隱私法》(FERPA) 對學生教育紀錄的保護那樣的隱私規範,限制了什麼可以串接、什麼可以釋出,而一項站得住腳的研究會說明它的資料使用協定 (data-use agreement) 與去識別化 (de-identification),不會把它們留在暗處。發展與教育領域有很多工作是對檔案性縱貫研究的次級分析 (secondary analysis),而雖然資料早於分析者存在,分析計畫並不是:估計標的、模型、恆等性與量尺化的檢查,以及那些敏感度分析,即使在資料已經蒐集完畢的情況下也可以、而且應該預先註冊 (preregister),因為預先註冊約束的是分析者,不是資料。
34.3 個案研究 B:發展連鎖
第二個個案研究轉向交易,也就是「系統會隨時間彼此塑造」這個發展的想法,因而一個孩子的語文能力會拉起後來的作業能力、或投入會拉起後來的成就;而它堅持連鎖文獻太常忽略的那份估計標的紀律。資料是模擬的 wisc 紀錄,一個語文與作業能力的雙變量設計,在四個年度波次 (annual wave) 上測量 \(900\) 名兒童,以一個已知的交叉延宕歷程建成,其中穩定的個人特質在兩個領域之間相關,而個體內的交易是有方向的,語文帶動後來的作業遠多於反過來,並且由社經地位調節 (moderate) 那份交易的強度。這樣的建構讓分析可以被稽核,而更重要的是,讓錯誤模型的後果得以被展示。
34.3.1 把特質與交易分開
一項連鎖主張的估計標的是一個個體內效果:問題是一個「比他自己平常更高於語文能力」的孩子,會不會接著變得「比他自己平常更高於作業能力」,那是一個關於「偏離一個人自己軌跡的個體內離差」的陳述。傳統的交叉延宕追蹤模型估計不了這個,因為它是把觀察分數對觀察分數作迴歸、沒有把穩定的個體間差異分出來,於是它的交叉延宕係數把個體內的交易與穩定特質的個體間相關混在一起,而第 21 章的隨機截距交叉延宕追蹤模型 (RI-CLPM) 存在的目的正是要完成這道分離。把兩者配適到同一份資料上,隨機截距模型還原出植入的有方向連鎖,語文到作業的個體內路徑 \(0.202\)、對照真值 \(0.25\),舒服地落在它的信賴區間 (confidence interval) 之內;作業到語文的路徑則接近零,\(0.058\)、對照真值 \(0.05\);而相關的穩定特質由 \(0.53\) 的個體間共變數 (covariance) 捕捉。反觀沒有隨機截距的傳統模型,它把不對稱壓平了,把語文到作業的路徑拉低到 \(0.154\)、把作業到語文的路徑灌大到 \(0.093\),於是真值裡五比一的方向比 (directional ratio) 塌成不到二比一,連鎖的方向也被弄糊了。圖 34.6 呈現這個對比與那份調節,而表 34.5 把估計值擺在真值旁邊。
註:子圖 (a) 畫出個體內的交叉延宕係數。隨機截距交叉延宕追蹤模型(藍)還原出植入的有方向連鎖,貼近真值(灰),語文到作業的路徑強而反向的路徑接近零;傳統的交叉延宕追蹤模型(橘紅)因為沒有隨機截距,把相關的穩定特質吸收進延宕係數,於是把不對稱壓平了。子圖 (b) 呈現分社經組估計的語文到作業路徑:社經地位較高的兒童連鎖比較強,那是植入的調節。
表 34.5 連鎖模型家族:估計值對照真值。
| 量 | 真值 | RI-CLPM | CLPM |
|---|---|---|---|
| 語文 \(\rightarrow\) 作業 | \(0.25\) | \(0.202\) | \(0.154\) |
| 作業 \(\rightarrow\) 語文 | \(0.05\) | \(0.058\) | \(0.093\) |
| 特質共變數/相關 | \(0.50\) | \(0.53\) | (被吸收) |
| 方向比 | \(5.0\) | \(3.5\) | \(1.7\) |
註:隨機截距模型(RI-CLPM)還原出個體內的有方向連鎖;傳統模型(CLPM)把相關的穩定特質與延宕動態混在一起,並把方向比壓縮。把 CLPM 的交叉延宕係數當成連鎖證據來報告的那個已發表習慣,正是這個比較所針對的對象。
一個雙變量的潛在變化分數模型,也就是第 20 章那個耦合的雙變化分數設定,在另一種參數化上提供第二種視角,其中一個領域的變化被另一個領域的先前水準 (prior level) 預測。它在連鎖的方向上與隨機截距模型一致,給出語文到作業的耦合 (coupling) \(0.099\)、對照作業到語文的 \(0.078\),但那份不對稱在這個度量上比較溫和,而模型的參數共變異數矩陣在這裡接近奇異 (near-singular),因此它被讀成對方向的佐證、而不是對大小的獨立估計;兩個模型家族的調和則依循 Usami 及其同僚的架構,而不是把它們當成互相競爭的對手。那份調節是靠著在社經地位的中位數切分 (median split) 上釋放語文到作業的路徑來估計的,它還原出社經地位較高的兒童有比較強的連鎖,\(0.274\) 對社經地位較低兒童的 \(0.133\),那是植入的交互作用;而在一項實質研究裡,它會招來一段關於「什麼樣的資源讓一項發展中的能力得以槓桿另一項」的討論。
34.3.2 延宕背後的那個間隔
一個在年度波次上估出來的交叉延宕效果,對它所依據的那個間隔是沉默的,而那份沉默是一個陷阱。一個個體內的延宕效果不是一個固定的量,而是測量間隔的一個函數,由零延宕時的零上升、在某個歷程特有的間隔上達到高峰、然後衰減,那正是第 27 章連續時間 (continuous-time) 的邏輯,因而一個年度波次的連鎖估計值取樣的是底下一條曲線上的單一一點,而一項採半年或兩年波次的研究,對同一個歷程會報出一個不同的數字。圖 34.7 在概念上把這一點畫出來。這對發展連鎖研究的意涵不是「年度設計是錯的」,而是它們的估計值是間隔特定的,而不同間距的研究之間的比較,是曲線上不同點之間的比較、不是同一個效果之間的比較,而在間隔結構有變動時,一個連續時間的表述才是有原則的補救。
註:概念示意。一個個體內的交叉延宕效果隨測量間隔而變,這裡先上升、在一年左右的延宕附近達到高峰、然後衰減。一個年度波次的設計報告的是被標出來的那單一一點;一個間距不同的設計,對同一個底層歷程會報出不同的值。跨研究比較交叉延宕係數,隱含地假定了一個很少被滿足的共同間隔,而第 27 章的連續時間模型直接處理這件事。
常見陷阱 • 只憑交叉延宕追蹤模型就談連鎖
已發表的發展連鎖文獻密布著建立在傳統交叉延宕追蹤模型上的主張,其中任何一對顯著的交叉延宕係數都被讀成「一個系統驅動另一個」的證據。問題在於,這樣的交叉延宕係數把穩定的個體間差異與個體內的交易混在一起,因而兩個只是在穩定水準上相關的構念,會在完全沒有任何交易的情況下產生顯著的交叉延宕係數。一項連鎖主張需要一個把「人的穩定水準」與「人繞著它的波動」分開的模型,也就是一個隨機截距交叉延宕追蹤模型或一個潛在變化分數模型,而一項只報告傳統交叉延宕係數的研究,還沒有為理論所意指的那個個體內意義上的連鎖提供證據。這項修正並不新,但它被採用的程度並不完整,而一位審查者有權要求它。
34.4 個案研究 C:認知老化中的變異性與叢發
第三個個案研究轉向生命全程的另一端,也轉向一種「以快的時間尺度取樣一個慢的歷程」的設計,也就是測量叢發設計,其中一段段短期的密集每日測量以長間隔重複進行,好讓快速的個體內動態,在它們自己隨老化這條慢的發展時間而改變的過程中被追蹤到。資料是模擬的 burst_aging 紀錄:\(250\) 位長者在三年之內接受三次叢發的每日施測,每次叢發之內每日記錄訊息處理速度 (processing speed) 與記憶失誤 (memory lapse),並在每次叢發記錄一次認知複合分數。這個設計是為了承載老化文獻的招牌假設而建的,也就是個體內的表現不一致在平均數下降之前就先上升;同時也讓檢驗那項假設的兩個危害看得見,一是讓動態產生偏誤的短序列,二是讓平均數產生偏誤的選擇性流失。
34.4.1 三個分析層
一個叢發設計支撐三個時間尺度上的三個不同估計標的,而表 34.6 把它們列出來。在一次叢發之內,每日資料支撐一個個體內平均數、一個個體內變異性,以及一個個體內自我相關 (autocorrelation),後兩者正是老化文獻當成構念本身在看的那份表現不一致與那份遲緩。在叢發之間,這些「人乘叢發」的量橫跨老化這段慢時間的改變,就是發展的估計標的,因此問題不只是平均數會不會下降,還包括變異性會不會增長、動態會不會變慢。而在波次層次上,認知複合分數提供了一個錨定的結果 (anchoring outcome),用來驗證那些快時間尺度的指標。圖 34.8 呈現一位受試者原始的多時間尺度結構,他的叢發平均數往上漂移、也就是反應變慢,而日與日之間的分散橫跨三次叢發越變越寬。
表 34.6 叢發的分析層:時間尺度、估計標的與模型。
| 層 | 估計標的 | 模型 |
|---|---|---|
| 叢發之內 | 平均數、個體內標準差 (iSD)、自我相關 | 逐人逐叢發的描述;AR(1) |
| 叢發之間 | 平均數、iSD 與自我相關橫跨老化的改變 | 那些「人乘叢發」量的成長 |
| 波次層次 | 認知水準與它的下降 | 複合分數軌跡;流失模型 |
註:一份叢發資料在三個時間尺度上各給出估計標的。發展的問題住在叢發之間那一層,在那裡,變異性的改變與動態的改變、而不只是水準的改變,才是關心的現象。
註:一位長者橫跨三年三次叢發的每日訊息處理速度測量,叢發平均數以橘紅標出。平均數往上漂移,也就是反應變慢,而到第三次叢發時日與日之間的分散明顯變寬。這張圖說明了為什麼需要一個叢發設計:變異性的改變對一個「每波只測一次」的設計是看不見的,因為它住在叢發之內那個時間尺度上。
34.4.2 變異性會先於下降嗎?
老化文獻的招牌假設是個體內的表現不一致是一個早期指標、在平均數本身下降之前就先上升,而叢發結構讓它得以被直接檢驗。橫跨三次叢發,母體平均訊息處理速度由第一次到第二次基本上持平,\(650\) 然後 \(656\) 毫秒,到第三次才升到 \(687\);而個體內變異性在第二次叢發就已經上升,三次的表現不一致中位數分別是 \(53\)、\(76\) 與 \(100\) 毫秒,因此變異性整整領先平均數一次叢發。圖 34.9 呈現那份領先。這項主張的個人層次版本,也就是「某位長者第二次叢發的變異性預告他隨後的下降」,得到支持但幅度不大:在完成者 (completer) 之中,把平均速度由第二次到第三次叢發的改變對第二次叢發的表現不一致作迴歸,得到一個 \(0.51\) 的正係數,標準誤 \(0.23\),\(p = .026\),相關大約 \(0.18\),那是真實但小的效果,也恰恰是應該不加灌水就照實報告的那種量級。這份清醒是刻意的,也呼應第 32 章對「不要把早期預警指標讀得太多」的告誡:變異性作為一個領先的標記是一個真實而且有用的現象,而它不是任何一個個體軌跡的決定性預測因子。
註:橫跨三次叢發的個人軌跡(灰)與母體摘要(彩色)。子圖 (a):平均訊息處理速度由第一次到第二次叢發持平,第三次才上升。子圖 (b):叢發之內的變異性在第二次叢發就已經上升,整整領先平均數一次叢發。變異性領先水準就是老化文獻的招牌假設,這裡由一份被建成含有它的資料中還原出來,而個人層次的版本幅度不大。
34.4.3 變化中的動態與選擇性流失
在水準與變異性之外,動態本身也在改變:訊息處理速度在叢發之內的自我相關,也就是「一次慢反應之後跟著另一次慢反應」的那份遲緩,橫跨各次叢發上升;而在每次叢發之內以一個多層次自我迴歸 (multilevel autoregression) 估計它,還原出那份增加,三次叢發的自我相關分別是 \(0.12\)、\(0.20\) 與 \(0.28\)。這些估計值相對於植入的 \(0.25\)、\(0.36\) 與 \(0.47\) 是向下偏誤的,那來自十二天的短序列,也就是第 24 與 25 章所熟悉的小樣本動態追蹤偏誤 (dynamic-panel bias);但橫跨叢發的那份增加,也就是作為發展估計標的的「動態改變」訊號,被清楚地還原出來,而那正是這項研究在意的量。第二個危害是流失,而這裡它是訊息性 (informative) 的、不是良性的:在第三次叢發之前離開的長者,正是變異性比較大、下降比較快的那些人,因此第三次叢發的樣本是一個倖存者樣本,它天真 (naive) 的平均數低估了母體的下降幅度。第三次叢發完成者的天真平均數是 \(687\) 毫秒,而母體真值是 \(705\);以「模型化的留下機率 (probability of staying) 的倒數」為完成者加權,也就是一次把離去的高風險個案算回來的流失逆機率加權 (inverse-probability-of-attrition weighting),把估計值移到 \(696\),還原了大約一半的倖存者偏誤 (survivor bias),而剩下的落差提醒我們:這種校正只能就已測到的東西去調整。當結果與退出共享未測到的原因時,完整的補救是第 29 章介紹的「縱貫歷程與流失歷程的聯合模型」,而叢發設計裡的選擇性損耗正是那個一般問題的發展版本。
實務要點 • 倫理:跨波的允諾與偶然發現
發展研究是在兒童的允諾能力逐年成長的那些年裡取得同意的,而那份倫理義務是持續的、不是在收案時就一次履行完畢:允諾要隨著孩子成熟而重新取得,而一個設計要說明它如何對「在研究期間跨過發展門檻」的參與者重新徵得同意。縱貫的認知與教育測量可能浮現偶然發現 (incidental finding),例如一位長者出乎意料的下降、一個孩子的學習困難,而一項研究要事先界定什麼會被回報給參與者、家庭或學校,以及透過什麼管道,因為測量叢發那種每日施測的親密程度,與學校資料所在的機構脈絡,都提高了「看到某件應該處理的事」的可能性。原則是:照護的責任延伸到一段縱貫關係的整個跨距,不只是它的第一次接觸。
34.5 領域綜合
三個個案研究共用一個結構,而圖 34.10 把它抽象成一道主張階梯 (claims ladder),由「縱貫資料最穩固地支撐得起的」爬到「它最勉強地支撐得起的」。最底下坐著描述,也就是「一個平均數以某種形狀改變」這件事的紀錄,而只要測量站得住,成長模型就以高可信度交付得了它。它上面坐著變化的個別差異及其相關因素的刻畫,穩固的程度取決於測量是恆等的、量尺是等距忠實的。再上面坐著個體內的交易,也就是連鎖,它需要個體間與個體內成分被分開,而年度設計只在一個固定的間隔上估得到它。而最上面坐著發展的解釋,也就是「一件事引起另一件事在發展上的浮現」這個主張,它被縱貫的描述所限制、卻不被它建立起來,因為正如 Wohlwill (1973) 所論證、Baltes and Nesselroade (1979) 所堅持的,描述變化與解釋發展是兩項不同的成就,而兩者之間的落差是由理論與設計架起來的,不是靠一段更長的追蹤。
註:縱貫資料對各種主張的支撐並不均勻。平均變化的描述是最穩固的一階;個別差異及其相關因素要求測量站得住;個體內的交易要求特質與交易被分開,而且是間隔特定的;發展的解釋要求追蹤本身之外的理論與設計。把一項主張定位在階梯上,就是那份「不讓一份縱貫描述被推銷成一項發展解釋」的紀律。
一位發展或教育期刊的審查者會針對這個領域的特徵性弱點施壓,而預期它們是分析者的工作。審查者會問:時間計量配不配得上估計標的、替代方案有沒有被檢視;測量有沒有被證明在所比較的各年齡上恆等;成長結論撐不撐得過一個替代的垂直量尺;流動有沒有被模型化、而不是被刪掉;加速設計的收斂有沒有被檢定、而不是被假定;一項連鎖主張是不是建立在一個把特質與交易分開的模型上;一項「變異性即早期指標」的主張有沒有連同它不大的效果量與被誠實處理的流失一起報告;以及一個學習月數的轉譯有沒有帶著它的量尺與它的但書。這些每一項都是三個個案研究公開作過決定的地方,而那些錨定文獻為想走得更深的讀者指路:成就成長與學校效果的經典在 Raudenbush and Bryk (2002) 與 Bryk and Raudenbush (1988),垂直量尺化的權威在 Kolen and Brennan (2014)、它的後果在 Briggs and Weeks (2009),連鎖的框架在 Masten and Cicchetti (2010) 與 Sameroff (2009)、估計標的的紀律在 Curran et al. (2014),而老化變異性的研究方案在 Ram and Gerstorf (2009)、MacDonald et al. (2003) 與 Lövdén et al. (2007)。這個給了縱貫方法學第一批問題的領域,也持續拋出它最難的測量問題,而它獎賞的手藝正是本章試著實踐的那一種:讓測量的決定被看見,因為在發展研究裡,它們不是科學的前置作業,它們就是科學的一部分。
軟體提示
這些分析只用了廣泛可得的套件。成長模型與交叉分類模型以 lme4 配適,它的交叉隨機效果語法在「學校識別碼在兒童之內變動」時原生就處理得了學生流動。縱貫恆等性、隨機截距交叉延宕追蹤模型與雙變量潛在變化分數模型以 lavaan 配適,恆等性序列以標記變項 (marker-variable) 法手工建起、並在截距恆等性那一步釋放因素平均數 (factor mean),因為 semTools 裡的自動恆等性輔助函式在這裡並不需要。彈性檢查用 mgcv。垂直量尺化的敏感度、叢發層次的表現不一致與自我相關,以及流失逆機率加權,都以基礎 R 手寫;而資料產生器 (data generator) 與分析腳本都設了種子 (seed)、隨章附上,因此本章的每一張圖都可以對照植入的真值重新產生。
本章摘要
發展與教育是縱貫測量最難的地方,而本章的教訓是測量的決定先於、而且限制住建模的決定。個案 A 把一份加速的、巢套在學校之下的成就資料帶過測量到政策的鏈條,顯示:時間計量跟著估計標的走;恆等性許可了那個複合分數;一把垂直量尺是一項建構,它的選擇可以翻轉一個成長結論、或讓一個差距擴大的估計值擺動近七倍;流動必須以交叉分類來模型化;加速設計的收斂是可檢定的;而一個學習月數的轉譯必須帶著它的量尺。個案 B 把穩定的特質與個體內的交易分開,以一個隨機截距模型還原出一份有方向的連鎖,而傳統的交叉延宕追蹤模型會把它壓平;並指出一個延宕效果對它所依據的間隔是特定的。個案 C 以一個測量叢發設計檢驗變異性是否先於下降,在母體層次上找到那份領先、在個人層次上找到一份不大的關聯,在短序列的向下偏誤之中還原出一份真實的動態變慢,並以對訊息性流失的加權校正一個倖存者偏誤的平均數。發展的主張階梯依每一項發現的推論要求把它定位,而貫串全章的那條線是 Wohlwill 在「描述變化」與「解釋發展」之間所作的區分。
本章重要名詞中英對照
| 中文 | English | 說明/首次出現處 |
|---|---|---|
| 時間計量 | time metric | 建模時用的那個時鐘(年齡、年級、波次);由估計標的決定;第 34.2 節 |
| 加速設計 | accelerated design | 以重疊的世代拼接出單一世代未被追蹤過的跨距(承第 2、14 章);第 34.1 節 |
| 世代收斂 | cohort convergence | 各世代在共有年級上共享同一成長歷程的可檢定假設;第 34.2 節 |
| 垂直量尺化 | vertical scaling | 以跨年級的共同題目把不同年級的分數放到同一條連續線上;第 34.2 節 |
| 年級當量分數 | grade-equivalent score | 以中位數表現定義的分數;非線性,不可作等距用;第 34.2 節 |
| 交叉分類 | cross-classification | 兒童與他前後就讀的幾所學校交叉,不是巢套(承第 23 章);第 34.2 節 |
| 學習月數 | months of learning | 把一個效果除以年平均增益再乘九個月的溝通裝置;第 34.2 節 |
| 發展連鎖 | developmental cascade | 一個發展中的系統帶動另一個(承第 20 章的指路);第 34.3 節 |
| 個體內的交易 | within-person transaction | 一個人偏離自己軌跡之後帶動另一個領域的效果;第 34.3 節 |
| 測量叢發設計 | measurement-burst design | 短期密集測量以長間隔重複(承第 2 章);第 34.4 節 |
| 表現不一致 | performance inconsistency | 叢發之內的個體內標準差;老化文獻的構念;第 34.4 節 |
| 流失逆機率加權 | inverse-probability-of-attrition weighting | 以留下機率的倒數為完成者加權,校正倖存者偏誤;第 34.4 節 |
| 倖存者偏誤 | survivor bias | 完成者樣本的平均數低估母體的下降;第 34.4 節 |
| 發展主張階梯 | developmental claims ladder | 把結論的語言釘在推論要求上的四階;第 34.5 節 |
參考文獻
Baltes, P. B., & Nesselroade, J. R. (1979). History and rationale of longitudinal research. In J. R. Nesselroade & P. B. Baltes (Eds.), Longitudinal research in the study of behavior and development (pp. 1–39). Academic Press.
Briggs, D. C., & Weeks, J. P. (2009). The impact of vertical scaling decisions on growth interpretations. Educational Measurement: Issues and Practice, 28(4), 3–14. https://doi.org/10.1111/j.1745-3992.2009.00158.x
Bryk, A. S., & Raudenbush, S. W. (1988). Toward a more appropriate conceptualization of research on school effects: A three-level hierarchical linear model. American Journal of Education, 97(1), 65–108. https://doi.org/10.1086/443913
Curran, P. J., Howard, A. L., Bainter, S. A., Lane, S. T., & McGinley, J. S. (2014). The separation of between-person and within-person components of individual change over time: A latent curve model with structured residuals. Journal of Consulting and Clinical Psychology, 82(5), 879–894. https://doi.org/10.1037/a0035297
Duncan, T. E., & Duncan, S. C. (2009). The ABC’s of LGM: An introductory guide to latent variable growth curve modeling. Social and Personality Psychology Compass, 3(6), 979–991. https://doi.org/10.1111/j.1751-9004.2009.00224.x
Ferrer, E., Shaywitz, B. A., Holahan, J. M., Marchione, K., & Shaywitz, S. E. (2010). Uncoupling of reading and IQ over time: Empirical evidence for a definition of dyslexia. Psychological Science, 21(1), 93–101. https://doi.org/10.1177/0956797609354084
Grimm, K. J., An, Y., McArdle, J. J., Zonderman, A. B., & Resnick, S. M. (2012). Recent changes leading to subsequent changes: Extensions of multivariate latent difference score models. Structural Equation Modeling, 19(2), 268–292. https://doi.org/10.1080/10705511.2012.659627
Hertzog, C., Lindenberger, U., Ghisletta, P., & von Oertzen, T. (2006). On the power of multivariate latent growth curve models to detect correlated change. Psychological Methods, 11(3), 244–252. https://doi.org/10.1037/1082-989X.11.3.244
Hoffman, L., & Stawski, R. S. (2009). Persons as contexts: Evaluating between-person and within-person effects in longitudinal analysis. Research in Human Development, 6(2–3), 97–120. https://doi.org/10.1080/15427600902911189
Kolen, M. J., & Brennan, R. L. (2014). Test equating, scaling, and linking: Methods and practices (3rd ed.). Springer. https://doi.org/10.1007/978-1-4939-0317-7
Lövdén, M., Li, S.-C., Shing, Y. L., & Lindenberger, U. (2007). Within-person trial-to-trial variability precedes and predicts cognitive decline in old and very old age: Longitudinal data from the Berlin Aging Study. Neuropsychologia, 45(12), 2827–2838. https://doi.org/10.1016/j.neuropsychologia.2007.05.005
MacDonald, S. W. S., Hultsch, D. F., & Dixon, R. A. (2003). Performance variability is related to change in cognition: Evidence from the Victoria Longitudinal Study. Psychology and Aging, 18(3), 510–523. https://doi.org/10.1037/0882-7974.18.3.510
Masten, A. S., & Cicchetti, D. (2010). Developmental cascades. Development and Psychopathology, 22(3), 491–495. https://doi.org/10.1017/S0954579410000222
McArdle, J. J., & Epstein, D. (1987). Latent growth curves within developmental structural equation models. Child Development, 58(1), 110–133. https://doi.org/10.2307/1130295
Miyazaki, Y., & Raudenbush, S. W. (2000). Tests for linkage of multiple cohorts in an accelerated longitudinal design. Psychological Methods, 5(1), 44–63. https://doi.org/10.1037/1082-989X.5.1.44
Nesselroade, J. R. (1991). The warp and woof of the developmental fabric. In R. M. Downs, L. S. Liben, & D. S. Palermo (Eds.), Visions of aesthetics, the environment, and development: The legacy of Joachim F. Wohlwill (pp. 213–240). Lawrence Erlbaum Associates.
Ram, N., & Gerstorf, D. (2009). Time-structured and net intraindividual variability: Tools for examining the development of dynamic characteristics and processes. Psychology and Aging, 24(4), 778–791. https://doi.org/10.1037/a0017915
Raudenbush, S. W., & Bryk, A. S. (2002). Hierarchical linear models: Applications and data analysis methods (2nd ed.). Sage.
Salthouse, T. A. (2014). Why are there different age relations in cross-sectional and longitudinal comparisons of cognitive functioning?. Current Directions in Psychological Science, 23(4), 252–256. https://doi.org/10.1177/0963721414535212
Sameroff, A. (Ed.). (2009). The transactional model of development: How children and contexts shape each other. American Psychological Association. https://doi.org/10.1037/11877-000
Schaie, K. W. (1965). A general model for the study of developmental problems. Psychological Bulletin, 64(2), 92–107.
Sliwinski, M. J. (2008). Measurement-burst designs for social health research. Social and Personality Psychology Compass, 2(1), 245–261. https://doi.org/10.1111/j.1751-9004.2007.00043.x
Tong, Y., & Kolen, M. J. (2007). Comparisons of methodologies and results in vertical scaling for educational achievement tests. Applied Measurement in Education, 20(2), 227–253. https://doi.org/10.1080/08957340701301207
Wohlwill, J. F. (1973). The study of behavioral development. Academic Press.