友情提示:如果本网页打开太慢或显示不完整,请尝试鼠标右键“刷新”本网页!阅读过程发现任何错误请告诉我们,谢谢!! 报告错误
狗狗书籍 返回本书目录 我的书架 我的书签 TXT全本下载 进入书吧 加入书签

女士品茶-第20章

按键盘上方向键 ← 或 → 可快速上下翻页,按键盘上的 Enter 键可回到本书目录页,按键盘上方向键 ↑ 可回到本页顶部!
————未阅读完?加入书签已便下次继续阅读!



俊K侵皇且蠖琳吖鄄炝街窒嗨频耐夹危⒁源宋谰葜っ鞲龅纳煞匠淌钦返摹M臣品治錾弦丫っ髡庵钟萌庋奂煅榈姆绞侥衙獬龃怼R蛭萌庋叟卸侠嗨频幕蚣负跬耆嗤牧礁鐾夹危绻挠梦四康拇唇ǖ耐臣品治龉ぞ咦邢讣煅橹蠡岱⑾郑秸咄谴蟛幌嗤摹�

皮尔逊的假使优度检验
这是K?皮尔逊在他的学术生涯早期就已经意识到的一个问题,K?皮尔逊最伟大的成就之一就是创造出第一个“拟合优度检验“(goodness of fit test)。通过观测值与预测值的比较,皮尔逊构造出一种能对拟合优度进行检验的统计量,并称之为“χ2拟合优度检验”(chisquare goodness of fit test)。之所以用希腊字母χ(读作“kai”),是因为这个检验统计量的分布属于一组偏斜分布,而他称这组偏斜分布为χ家族(chi family)。实际上,这个检验统计量很像χ的平方,因此命名为“χ2”。在费歇尔看来,既然是一个统计量,就会服从一种概率分布。K?皮尔逊证明了无论用哪一种类型的数据,χ2拟合优度检验都服从相同的分布。也就是说,他能列出这个统计量的概率分布表。每一个检验都能用到同样的那套表。χ2拟合优度检验只有一个参数,费歇尔称之为“自由度”。费歇尔在1922年的那篇论文里,首次批评了皮尔逊的研究,指出在比较两种比例时,皮尔逊得出的那个参数值是错误的。
但是,没有任何理由只因为皮尔逊理论上的一个很小的错误,就贬低他的这项伟大成就。皮尔逊的拟合优度检验是现代统计分析中一个重要组成部分的先驱,这个重要组成就是“假设检验”(hypothesis testing)或“显著性检验”(significance testing),它允许分析人员提出用来模拟现实的两种(或多种)不一致的数学模型,然后利用数据来放弃其中的一个。假设检验应用得如此广泛,以至于很多科学家认为这是他们唯一能用的统计方法。在后面的章节中我们会发现,假设检验的应用甚至涉及到一些严肃的哲学问题。

检验女士是否真能品尝出茶的区别
假设我们要检验那位女士能否品尝出两杯茶的不同:是把牛奶倒进了茶水里,还是把茶水倒进牛奶里。我们给她两杯茶,告诉她一杯是茶水倒入牛奶里,另一杯是牛奶倒入茶水中。她尝了尝,正确区别开了这两杯茶。有可能她是凭猜测,猜对的机会是一半对一半。我们再给她同样的这样两杯茶,她又说对了。如果她仅仅靠猜测,那么连续两次都猜对的机会是四分之一。如果我们再给她两杯茶,假如她仍然能正确地分辨出来。若这人结果完全是猜出来的,此时猜对的机率则只有八分之一。我们继续两杯两杯地让她品尝更多杯茶,而她依然每次都能够正确地识别出来。某种意义上,我们就不得不相信她真的能品尝出其中的差别了。假定她说错了一次,假定说错的这一次就发生在第24组,而其他的全对,那么我们能否依然认为她真的有分辨不同奶茶的能力呢?假如她的错误是二十四分之四呢?或是二十四分之五呢?
假设检验(或者说显著性检验)是一种正规的统计方法,是在“待检验的假设为真”的假设前提下,用来计算以往观测到的结果发生的概率。当观测结果发生的概率很低时,我们得出原假设不成立的结论。重要的一点是,假设检验提供了一种拒绝某个假设的工具。上述例子中,待检验的假设是:那位女士只是凭猜测。假设检验的目的不是让我们接受某个假设,即使与那个假设有关的概率非常高也不能接受。
在这个普遍被接受的概念发展的早期,“significant”(显著的)这个词只是用来指“概率低到足以拒绝的程度”,数据如果可以用来拒绝某个分布,则它就是显著的。在19世纪后期的英语里,这个词仅仅是指计算结果意味着或表明了什么意思。进入20世纪之后,英语“significant”这个词在原有含义的基础上又扩展了其他的解释意义,也指某些事情是非常重要的。在某个待检验的假设条件下,统计分析仍沿用“significant”这个词“显著的”含义来表示计算结果发生的概率很低,在这个层面上,“significant”这个词有一个精确的数学涵义。但令人遗憾的是,使用统计分析的人常把显著性检验统计量理解为某种更接近这个词的现代语意的东西。

费歇尔对P值的运用
现在运用的显著性检验方法,其中大部分都是费歇尔构造出来的。他把判定具有显著性的那个概率,称为“P值”(Pvalue)。他对P值的涵义和有效性坚信不疑。在《研究工作者的统计方法》一书中,很多地方都专门介绍了怎么计算P值。正如我在开头的时候谈到的,这是一本专门给想要应用统计方法的非数学专业人士写的书。在这本书中,费歇尔并未解释这些检验是如何推导出来的,也从没有明确指出究竟多大的P值才算是显著的。他只是举出一些计算实例,并说明结果是否显著。在一个例子中,他给出一个小于0。01的P值,并且说明“一百个值当中,只有一个值会偶然超过(计算出来的检验统计量),因此,很显然,计算结果之间的差异具有显著性。”
1929年,费歇尔在《心灵研究学会刊》(Proceedings of the Society for Psychical Research)上发表的一篇论文中,几乎等于定义了一个在任何情况下都将是显著的特殊的P值。“心灵研究”(psychical research)提到试图用科学的方法来证明“超视力”的存在。心理学的研究人员大量运用了统计学的显著性检验来证明,在受实验者完全随意猜测这种假设条件下,其结果是不可能的。费歇尔在他这篇论文中,先是谴责某些作者完全错误地使用了显著性检验,接着他申明说:
运用生物学的方法对生物界进行观察的时候,统计学的显著性检验是必不可少的。其作用就在于防止我们被一些非主要的偶发事件所欺骗。并不是因为我们希望去研究或试图去查明这些偶发事件,而是因为它们与许多我们无法控制的其他境况联系在一起。一个观测的结果,倘若在我们正在寻找的真正原因根本不存在的情况下,几乎从未发生过,可以判断这个观测具有显著性。如果偶然发生的机率低于二十分之一,通常的做法是判断其结果具有显著性。对实际调查者来说,显著性水平的选择是任意的,但便于应用。不过,它并不意味着可以让自己每20次实验中就被骗一次。显著性检验只是告诉他什么是应该忽略掉的,也就是说应该把所有那些无法得到显著性结果的实验忽略掉。当他知道如何设计一个实验,而这个实验几乎一定能给出一个显著性的结果时,他也只能说明,这仅是一种实验上可以验证的现象。所以,对那些孤立的具有显著性的结果,他不知道如何才能让它们再现出来,只能留待以后再做进一步的调查研究了。
注意“……知道如何设计一个实验,而这个实验几乎一定能给出一个显著性的结果……”这句话,正是费歇尔使用显著性检验的核心之所在。对费歇尔而言,显著性检验只有在连续实验的相互联系中才有意义,所有这些实验的目的在于解释特定处理的作用。读过费歇尔的应用性论文之后,你会在他的引导下相信,使用显著性检验是为了得出三种可能的结论之一:如果P值很小(通常小于0。01),他断言某种结果已经显现出来;若P值很大(通常大于0。2),他宣称即便真的存在一个结果,也会因为该结果发生的可能性太小,所以不可能有任何显示出这个结果的大规模的实验;如果P值介于前两者之间,他讨论了应该如何设计下一个实验,才能得到一个更好的结果。除了上述情况,费歇尔从来没有明确说明科学家应该怎么解释P值。对费歇尔而言,看上去是如此显而易见的事,对读者来说可能并不清楚。
我们将在第18章回过头来重新审视费歇尔对显著性检验的态度。费歇尔始终坚持,从来都没有显示过吸烟有害健康,这也正是他的一个较大错误的核心之所在。费歇尔对有关吸烟和健康的证据做了犀利的分析,我们暂且把它放下,以后再谈。现在把话题转到1928年,看看当时35岁的耶日?奈曼。

J?奈曼的数学教育
当第一次世界大战在东欧爆发,奈曼的祖国陷于战火之中的时候,他还是一个在数学系读书的非常有发展前途的大学生。他被迫搬到俄国,就读于卡尔可夫大学
返回目录 上一页 下一页 回到顶部 赞(0) 踩(0)
未阅读完?加入书签已便下次继续阅读!
温馨提示: 温看小说的同时发表评论,说出自己的看法和其它小伙伴们分享也不错哦!发表书评还可以获得积分和经验奖励,认真写原创书评 被采纳为精评可以获得大量金币、积分和经验奖励哦!