CIE 9990 Paper 2 专属。🐱巧手猫拿出工具箱——实验、相关、个案、调查,加上抽样、伦理、数据分析。学会它,你就能评价任何研究。

~ 心理学家的工具箱 ~
控制变量,找因果。最严谨。
找关系,但不能说因果。
深入一个人(如 H.M.)。
问卷/访谈,量大但浅。
💡 核心:没有"最好"的方法——只有"最适合研究问题"的方法。问"X 导致 Y 吗"用实验;问"X 和 Y 有关系吗"用相关。
自变量 IV:研究者操纵的变量。
因变量 DV:被测量的结果。
额外变量 Extraneous:可能干扰 DV 的因素(须控制)。
混淆变量 Confounding:已实际与 IV 混在一起、改变结果的变量。
控制方法:随机分配、标准化程序、counterbalancing 平衡。

~ IV / DV / 控制变量 ~
独立组(independent groups):每组被试只做一种条件。✓ 无顺序效应;✗ 需更多人、有个体差异。
重复测量(repeated measures):同一批被试做所有条件。✓ 省人、无个体差异;✗ 顺序效应(需 counterbalancing 平衡)。
配对组(matched pairs):两组被试按关键特征配对。折中方案。
💡 区分(考点):问"X 导致 Y 吗"用实验;问"X 和 Y 有关吗"用相关。相关 ≠ 因果。🧋奶茶测评:A组只喝全糖、B组只喝半糖=独立组;同一批人先全糖后半糖=重复测量(需AB/BA平衡"喝腻"顺序效应)。
人工环境、严格控制 IV/DV,随机分配。
✓ 内部效度最高、可重复;✗ 生态效度最低(人为)。
自然环境中操纵 IV,仍控制 DV。
✓ 生态效度高;✗ 难控制混淆变量。如 Piliavin 地铁助人。
IV 自然发生(如政策、灾害),研究者无法操纵。
✓ 真实、伦理友好;✗ 无法随机分配、难断因果。
基于既有分组(如性别/年龄),无法随机分配。
✓ 研究真实差异;✗ 个体差异可能混淆 IV。

💡 考点:区分"自然实验"(IV 自然发生)vs"准实验"(按既有特征分组,无法随机分配)。生态效度:实验室 < 准 < 现场 ≈ 自然。
方向性(directional):预测方向。"A 组成绩高于 B 组"。→ 需理论依据支持才敢写方向。
非方向性(non-directional):只说"有差异",不定向。"A、B 组成绩有差异"。
H₀:假设 IV 对 DV 无影响。"两组成绩无差异"。
统计检验就是为了决定是否拒绝 H₀。p < 0.05 → 拒绝零假设。
💡 写法口诀:假设必须可检验、可证伪,且明确点出 IV 与 DV。例:低剂量咖啡因(IV)会缩短反应时(DV)——这是方向性假设。
目标人群中每个人都有同等机会被选中。
✓ 最有代表性;✗ 实操难、耗时。
谁在就用谁(街头拦截、学生样本)。
✓ 快、便宜;✗ 偏差大(代表性差)。
登广告招募自愿者。
✓ 伦理友好;✗ 自我选择偏差。
按人口比例(性别/年龄)分组后随机抽。
✓ 代表性好;✗ 复杂。

~ 抽样与代表性 ~
⚠ 样本偏差 (sampling bias):Milgram 经典"语音反馈"实验为 40 名 20–50 岁美国男性;Asch 线条判断约 123 名美国男大学生——规模小且性别/地域单一 → 代表性差 (low population validity)。先问"这能推广到谁"。🏋️健身房门口测"全国运动时长"→全是爱运动的人,结论严重偏高。
知情同意(informed consent):被试知道要做什么。
保密(confidentiality):数据匿名。
退出的权利(right to withdraw):随时可走,无惩罚。
防伤害(protection from harm):身心不能受长期伤害。
欺骗(deception):有时实验必须隐瞒目的(如 Milgram)。需伦理委员会批准。
事后说明(debriefing):实验结束后告知真相、确保被试离开时状态良好。
→ Milgram/Zimbardo 都因伦理问题推动了现代规范。
💡 伦理 vs 科学价值:研究有欺骗时,需权衡"科学价值 vs 被试权益"。现代伦理委员会(IRB)必须事先批准。动物研究还需遵守 3R 原则:替代 (Replacement) / 减少 (Reduction) / 优化 (Refinement,即减轻痛苦、改善动物福利)。🔓事后说明=密室逃脱式实验后,研究者像剧透一样解释"其实在测 XX",确保你笑着离开。
定义:重复测量能得到一致的结果。
例:今天测 IQ 120,下周测 119 → 高信度。
检验:test-retest(重测)、inter-rater(评分者间)。
→ 信度是稳定性。
定义:测量的是真正想测的东西。
例:浴室体重秤每次都显示 60kg(高信度),但你实际 70kg(低效度)→ 测得一致但测错了。
三种类型(勿混用):内部效度(因果可信)、外部效度(推广到其他人群/情境)、生态效度(任务贴近真实生活)。
→ 效度是准确性。
💡 关键:信度是效度的必要不充分条件——可以稳定但测错东西,但不能不稳定还测对。实验室实验内部效度高但生态效度常受质疑。
定量(quantitative):数字。如电压、反应时、正确率。→ 可统计、可比较。
定性(qualitative):文字。如访谈、观察记录。→ 深度好、丰富,但难量化。
平均数 mean:÷个数,受极端值影响。
中位数 median:中间值,不受极端值影响。
众数 mode:最常出现的值。
全距 range:最大值−最小值。
标准差 SD:离散程度。SD 大=分布散。

~ 正态分布曲线 ~
称名 nominal(类别,如性别)→ 众数;等级 ordinal(有名次,如赛跑名次)→ 中位数。
等距 interval(如温度℃)/ 等比 ratio(如反应时,有真零点)→ 平均数可用。
💡 考点:CIE 可能要求计算 mean/median/mode,或解释某研究应选哪个。有极端值时用中位数,分类数据用众数。
两变量同向变化。学习时间↑,成绩↑。
r > 0,越接近 +1 越强。
两变量反向变化。压力↑,睡眠↓。
r < 0,越接近 −1 越强。
两变量无关。鞋码与 IQ。
r ≈ 0。范围 −1 ≤ r ≤ +1。
⚠ 第三变量陷阱:"冰淇淋销量↑ 溺水↑" → 真因是夏天。"鞋码大的孩子阅读更强"→ 真因是年龄。相关只能说明有联系,不能说明谁导致谁。
自然 vs 控制:在自然情境 vs 实验室。
参与 vs 非参与:研究者是否加入被观察群体。
公开 vs 隐蔽:被观察者是否知情。
取样:时间取样(按时段)vs 事件取样(按事件)。
先制定行为分类表(behavioral categories),再计数。
需多名观察者 → 检验 inter-observer reliability(评分者间一致性)。
⚠ 警惕观察者偏差(主观期待影响记录)。
💡 评价:✓ 高生态效度、记录真实行为;✗ 难重复、无法确定因果、伦理(隐蔽观察)受质疑。
利克特量表(Likert):1–5/1–7 打分,量化态度。
封闭式(选选项)vs 开放式(自由作答)。
✓ 快、量大、可量化;✗ 社会赞许偏差。
结构化:固定问题,可比较。
半结构化:有大纲可追问。
非结构化:像聊天,深度高。
✓ 深度、灵活;✗ 费时、难量化。
💡 共同陷阱:① 引导性/诱导性问题(措辞左右答案);② 社会赞许性(被试美化自己);③ 自我报告≠真实行为。
对个体/小群体长期、深入、多角度研究。
多源资料:深度访谈 + 档案 + 观察 + 测验。
纵向追踪:随时间变化。
经典:H.M.(海马切除)、Genie、Sperry 裂脑人。
✓ 深度极高、揭示罕见/独特现象、为理论提供丰富细节。
✗ 无法推广(n=1)、耗时、依赖研究者解释、记忆/回忆偏差。
→ 个案 ≠ 个例(anecdote),前者系统、后者随意。
💡 价值:个案研究常用于检验或生成理论——H.M. 证实了"陈述性长时记忆依赖海马",是双分离逻辑的经典证据。
p 值:结果"纯凭偶然"出现的概率。
显著性水平常取 p < 0.05(5%)→ 差异不太可能由偶然造成 → 拒绝零假设。
p 越小越显著,但"显著≠重要"。
I 型错误(假阳性):本无差异却判为有差异。
II 型错误(假阴性):本有差异却漏判。
检验分参数检验(如 t 检验,要求数据满足正态/等距)与非参数检验(要求低、适用更广)。
💡 关键:描述统计(mean/SD)只"总结";推断统计才"下结论"——判断差异是真实还是偶然。写报告时务必报告 p 值。
全文浓缩:目的/方法/结果/结论,约150字。
文献回顾 → 提出研究问题与假设(IV/DV)。
设计/被试/材料/程序——须可重复。
描述+推断统计、图表,不解释。
解释结果、与假设对照、评价、推广。
APA 格式列出所有引用文献。
💡 Method 段是 CIE 高频考查点:须写清实验设计、被试(数量/抽样)、标准化程序、控制变量,让他人能精确复制你的研究。
✓ 找因果、控制严谨
✗ 人工环境、生态效度低
✓ 真实变量、伦理友好
✗ 不能说因果
✓ 深度极高、独特信息
✗ 无法推广、耗时
✓ 量大、便宜
✗ 自我报告偏差、浅
💡 三角验证法(triangulation):用多种方法研究同一问题,互相印证——这是现代心理学提高可信度的重要策略。
自变量(操纵)/ 因变量(测量)。
信度(一致性)vs 效度(准确性)。
生态效度:能推广到现实生活吗?
欺骗 + 事后说明。伦理核心。
独立组 vs 重复测量设计各有什么优缺点?
信度和效度的关系是什么?
为什么"相关不是因果"?举个例子。
Explain one strength and one weakness of the experimental method. [6 marks]
Strength:能控制变量、确定因果关系。如 Loftus & Palmer (1974) 仅改变问题中的动词(IV:smashed vs hit)测量车速估计(DV),证明措辞影响估计。
Weakness:生态效度低——看视频 ≠ 真实目击车祸。
💡 常见错误:① 混淆随机抽样(选人)和随机分配(分组)。② 说"样本偏差"不说明为什么是问题。③ 忘记伦理评价。
① 方法-研究配对:每种方法配一个具体研究。
② 伦理清单:每个研究过一遍伦理四原则。
③ 统计练习:手算 mean/median/mode。
① Paper 2 考方法学为主。
② 评价要具体:不说"样本有偏差",说"全是美国男大学生,无法代表女性和其他文化"。
③ IV/DV 要写清:阅卷按此给分。
💡 核心:研究方法是 CIE 的"工具箱"——理解了它,你就能评价任何研究。这是从"记知识"到"会思考"的关键一步。
🎉 5 卷 · 四大取向 + 研究方法——你已经走完了整个 CIE 9990 AS Level 考纲。从生物取向的神经元到研究方法的统计分析,你都懂了。
Cambridge International AS & A Level Psychology Coursebook (CUP) · CIE 9990
CIE 9990 Syllabus (2024–2026) · 官方考纲文档