科学网—卢竞马宇翰孙昌璞|标准答案的边界:黑洞何以有温度——漫谈教育科技人才一体化实践中的科学精神-清华大学出版社学术期刊的博文
精选
已有 363 次阅读
2026-9-24 11:09
| 个人分类: 物理与工程 | 系统分类: 论文交流
本文选自《物理与工程》2026年第4期
卢竞 1 马宇翰 2 孙昌璞 3
(1湖南师范大学物理与电子科学学院; 2北京师范大学物理与天文学院; 3中国工程物理研究院研究生院)
摘要
某中学生物理竞赛决赛的一道黑洞热力学题涉及到黑洞质量趋于零时温度概念的误用。有限系统热力学及其对黑洞信息应用的前沿研究揭示,当黑洞质量趋近零时,通常的温度概念已不再适用。该案例揭示了相较解题错误更深层的科学教育上的矛盾:考试倾向于要求学生接受题设并复现“标准答案”,而科学研究则要求研究者直面真理、审查概念定义的有效性、理论的适用边界以及结论是否对应真实自然过程。当竞赛成绩又与稀缺升学机会相联系时,科学上的认识冲突可能转化为科学诚实与个人前途之间的结构性矛盾。本文提出,应把“模型内求解”与“模型外审查”同时纳入物理人才评价,并结合国际竞赛纠错机制、古德哈特定律和人工智能发展,建立科学异议保护、分层评分和命题红队审查制度,在物理学考试、竞赛和人才选拔中具体落实科学精神的培育。有限系统热力学、霍金辐射非热修正及蒸发末期的专业说明列于附录。
关键词 黑洞温度;霍金辐射;有限系统热力学;科学精神;物理竞赛;人才教育;人工智能
DOI: 10.27024/j.wlygc.2026.08.17.is
1 从一道竞赛题的“标准答案”谈起
某中学生物理竞赛决赛第五题(见附录)是一道富有思想启发性的题目 [1] 。其前半部分从施瓦西半径、贝肯斯坦—霍金熵和热力学关系出发推导黑洞温度,把引力理论、黑洞辐射与热力学联系起来,能够帮助学生体会不同物理理论之间深刻而优美的统一。然而,问题出现在后半部分:题目设定两个黑洞之间的可逆热机持续运行,要求学生首先要判断出系统状态的演化方向,进而得出较小黑洞的质量将会减小至零的结论;随后,又要求将基于霍金辐射的质量损失方程直接积分至零质量,并把所得时间解释为黑洞“最终消失”的时刻。这种处理在数学推导上可以完成,但它隐含了一个极强的物理前提:霍金温度公式、热辐射定律、 准静态近似 和可逆热机模型在黑洞质量任意小时仍然成立。
这一前提并不属于现有黑洞物理研究已经确立的结论。霍金温度公式 T H ∝1/ M 是在 半经典近似 下和质量不接近零时得到的 [3-4] :物质场被量子化,而引力背景仍被视为经典时空。对于宏观黑洞,或者至少对于仍远离普朗克尺度的黑洞,这一描述具有明确的物理意义。但当黑洞质量不断减小、 视界尺度 接近普朗克长度时,时空涨落、辐射反作用、有限尺度效应以及量子引力修正都可能变得不可忽略。此时,原有半经典近似是否仍然成立,辐射是否仍可严格视为正则统计热辐射,黑洞是否还能被看作具有确定温度的准静态热力学系统,都不能由原来的公式自动保证。特别是,温度并不是把某个形式表达式写成 T ( M )后自然存在的量。热力学温度的定义依赖于物理状态是否满足适当的平衡或准平衡条件,以及足以支持统计热力学描述的自由度结构。当系统本身趋于消失、状态变化时间与弛豫时间不再分离时,把 T H ∝1/ M 的形式发散继续解释为“零质量黑洞具有无穷高温”,已经超出了这一公式的可靠适用范围。因此,这里的问题不在于数值计算是否足够精确,而在于被计算的物理量在该区域是否仍有定义。
如果题面明确声明:在一个纯形式模型中,假定题目所给出的全部公式对任意正质量均严格成立,并忽略量子引力、辐射反作用、有限尺度效应以及 黑洞蒸发 末期的一切未知机制,那么把质量积分到零,可以被理解为在既定假设下进行的数学演算。所得结果描述的是这个理想模型的形式终点,而不必被解释为真实黑洞必然经历的物理终点。然而,原题采用了默认研究现实黑洞的语言,参考答案又把形式极限直接称为黑洞的“最终消失”,没有充分区分模型内部的推演与现实自然过程的结果。由此产生的主要问题,不是竞赛计算中某个系数或积分步骤的错误,而是对理论适用域缺乏必要说明:一个只在特定尺度和近似条件下成立的公式,被无条件外推到了理论本身可能失效的区域。因此,需要作出清楚而审慎的科学判断:宏观黑洞可以具有霍金温度;在半经典描述仍然可靠的范围内,黑洞蒸发也可以近似地用热力学语言研究;但当质量接近普朗克质量时,通常的温度、热谱、可逆循环和连续蒸发方程是否仍然成立,已经属于尚未解决的前沿问题。此时,不能把形式上的质量趋近零当作成熟理论所预言的真实过程,更不能把未知区域包装成只有一个确定结论的标准知识。
马宇翰曾针对这道竞赛题专文讨论黑洞热机及其与有限系统热力学的关系 [2] 。关于黑洞非热辐射、有限系统涨落和热力学可积性,不同的研究者也从不同角度表明:严格正则玻尔兹曼热谱、准静态状态和通常意义上的温度,都不能在缺少额外论证的情况下被延伸到系统消失的极限 [5-12] 。更专业的分析见文末附录。当然,黑洞蒸发和信息丢失的末期涉及量子引力、非平衡统计和有限系统热力学,原本就是尚在发展中的科学前沿。不能要求竞赛命题者掌握全部最新研究,更不应因为一道题存在理论边界不清的问题,就否定其启发性价值。由此,可以延伸探讨一个更普遍的原则:越是借用前沿科学概念,越应明确模型假设、适用范围和截止尺度;越是存在尚未解决的问题,越不能用成熟知识的口吻给出唯一而封闭的自然图景。科学精神首先体现为对概念边界的深刻认识。知道一个公式怎样使用固然重要,知道它为什么成立、在什么条件下成立,以及从哪里开始不再可靠,往往更加重要。
2 “标准答案”有时会与科学精神发生结构性冲突
考试与科学研究都需要知识、逻辑和计算,但二者的认识结构并不相同。考试通常先假定题目成立,要求学生接受给定条件,在有限时间内推导出预先设定的结果。科学研究则首先把问题本身也置于严格的科学审判之下:研究的问题是否有意义?研究对象是否能定义?给定条件是否彼此相容?假设能否检验或证伪?公式在哪个尺度上失效?数学极限是否对应实际过程?实验异常究竟来自操作误差,还是意味着原有理论需要修正?考试中的异常通常被视为需要排除的错误,科学研究中的异常却可能是新理论的入口。考试强调在既定框架内正确求解,研究则要求人们在必要时重新审查乃至突破框架。因此,“会做题”与“会研究”并不是完全相同的能力;一个人能够熟练推出标准答案,并不意味着他已经具备辨认问题边界、发现理论漏洞和分辨结果好坏美丑的能力。
这道黑洞题把两种认识结构之间的冲突集中呈现了出来。考生如果与参考答案一样把黑洞质量积分到零,可以得到完整而整齐的结果;考生若指出半经典理论在接近普朗克尺度时可能失效,拒绝把形式积分解释为真实黑洞的终点,其科学判断可能更加严谨,却也容易被认为“没有完成题目”或者“偏离标准答案”。在普通课堂中,这或许只是一次技术性的评分争议;但高水平竞赛往往与国家集训队、人才计划和顶级高校的选拔机会相联系,一次评分可能对学生未来的发展产生长期影响。此时,如何处理合理异议,就不再只是教师个人是否开明的问题,而成为人才选拔制度是否真正尊重科学精神的问题。同时,不应将此矛盾转化为对学生的道德考验,仿佛只有愿意放弃分数、名次和升学机会的人,才算忠于真理。要求未成年人以牺牲个人前途来证明科学诚实,实际上是将本应由制度承担的纠错成本转嫁给个人。真正成熟的科学共同体,不应依赖少数人以英雄主义方式对抗标准答案,而应建立能够容纳合理质疑、识别有效批判并及时纠正错误的常规程序。
科学家精神当然包含诚实、怀疑、独立判断和尊重证据,但它绝不只是对科学家个人品格的要求。它还表现为一个共同体是否愿意为不同意见保留空间,是否允许年轻人对权威提出有根据的质疑,是否能够公开承认知识的不确定性,并在制度出现错误时提供更正和补偿。这里所说的质疑,并不是为了反对而反对,也不是把所有已经建立的知识和科学前沿有定论的东西都说成“只是观点”,对就是对,错就是错。科学的批判精神有严格的内在要求:质疑者应当说明自己质疑的对象,指出所依赖的证据、逻辑和适用条件,并承担接受反驳和修正自身判断(即能够接受证伪检验)的义务 [13] 。真正的批判精神既敢于审查权威,也敢于审查自己;既不盲从标准答案,也不把未经论证的猜测冒充科学创新。因此,教育制度需要鼓励的不是任意提出异议,而是有根据、可讨论、能够接受证伪检验的异议。相应地,制度也不能只要求学生具备质疑能力,却不给质疑留下现实的生存和发展空间。
首先,在命题环节,涉及前沿理论或理想化模型时,应明确说明基本假设、近似条件和适用范围。若题目有意考查形式和逻辑推演,应当把“在所给假设对整个过程均成立”写入题面。这样既不妨碍数学计算,也能避免把理想模型误写成已经得到证实的自然过程。其次,在评分环节,不应把参考答案等同于唯一合理的思维路线。对于能够准确指出模型漏洞、理论失效尺度或概念定义难点,并给出充分论证的答案,应设置相应的得分空间。一个学生如果既能完成题目所要求的形式计算,又能明确说明计算结果只在特定假设下成立,这种答案理应被视为比机械复现参考答案水平更高的回答。再次,应建立独立、透明和可追溯的重复核查机制。对于涉及科学概念争议的竞赛题,申诉不应只由原命题者在原有框架内自我复审,而应邀请相关领域专家进行独立评议。若确认题目表述、参考答案或评分标准存在问题,应公开说明问题所在,并根据实际影响采取重新评分、恢复资格或其他补偿措施。只有制度愿意弥补自身错误造成的损害,才有资格要求学生坚持科学诚实。
应该特别保护提出合理异议的学生。学生对题目或权威观点提出批评,不应被简单解释为“不服从”、“钻牛角尖”或“缺乏解题能力”。如果质疑基于知识、证据和逻辑,教育者就应首先回应质疑本身,而不是评价质疑者的态度和身份。批判的对象应当是命题、论证和证据,而不是提出质疑的人。更进一步,科学精神与人才教育不能被分割成两套体系:一套体系通过标准化考试选拔所谓“聪明人”,另一套体系再通过报告、仪式和口号向他们补充“科学家精神”的内容。科学精神如果不能进入日常教学、命题和评价过程,就很容易退化为附加在知识教育之外的道德装饰。真正的一体化教育,应当使理论边界进入公式教学,使合理异议进入考试评分,使原始文献研读、重复验证、失败分析和模型比较进入科研训练。学习一个公式,不只是记住它能够计算什么,还要知道它从哪里来,依赖哪些假设,经由什么证据支持,又在什么条件下不再可靠。学习一个理论,也不只是了解它成功解释了什么,还应了解它存在哪些异常、争论和未解决问题。
科学家精神的体现,并不是一味反对标准答案,而是永远不把任何答案置于证据和理性审查之外。权威可以被尊重,但不能代替论证;共识可以作为研究起点,但不能成为禁止追问的终点;标准答案可以服务于教学和评价,但不能获得超越科学本身的豁免权。所谓“有组织的怀疑” [14] ,不能只依靠少数人的勇气,而应成为知识生产和人才培养的制度原则。一个真正鼓励创新的教育体系,不仅要奖励答对问题的人,也应当保护那些有能力发现“问题本身可能有问题”的人。因为科学进步不仅来自对既有问题给出更准确的答案,也常常始于对问题的前提、边界和提问方式重新作出审查 [15] 。
3 考试、竞赛和人才选拔的价值边界
考试和竞赛成绩是青少年科学潜能的一个有价值的代理指标,能够反映理解速度、专注力、形式推理和复杂问题求解能力。但古德哈特定律 [16] 提醒我们,当代理指标成为被高度追逐的目标时,它会逐渐失去对原目标的代表性;坎贝尔定律 [17] 进一步指出,高风险量化指标会反过来改变被评价的活动本身。当奖牌直接关联面试、保送以及进入清华、北大等名校的稀缺机会时,训练体系自然会关注题型识别、命题意图揣测和评分点复现等能力的提升,而这些能力并不等同于科学研究和社会实践中的问题选择、长期创造、实验判断,以及面对权威时坚持证据的能力。
数学与物理竞赛存在重要差别。数学问题一旦给出相容的定义与前提,核心任务是判断结论能否严格推出,竞赛中形成的构造、证明和提出反例能力,与数学的科学研究具有较强的关联性和一致性。数学的发展往往可以在“提出猜想—严格证明—构造反例—推广定理”的内部逻辑中形成相对闭合的知识循环。物理学则始终多出一层关于自然的判断和经验性检验:这个模型为什么可以描述当前过程?质点、理想气体、热平衡、连续介质,乃至牛顿力学、量子力学及其各种近似,都只在特定尺度和精度下有效。判断近似何时成立、何时失效,本身就是物理学。物理知识的闭环不是仅靠公式推演完成的,而要经过“现象—问题—模型—预测—实验—修正”的反复循环;任何一个环节脱离经验事实,逻辑上再严密,也未必构成可靠的物理知识。因此,数学竞赛解题能力与数学研究之间的连续性,通常强于物理竞赛解题能力与物理研究之间的连续性。这种差别也在一定程度上反映在两类竞赛获奖者后来的学术发展路径上:国际数学奥赛金牌得主中有不少人成为杰出数学家,而物理奥赛成绩与一流物理原创能力之间的对应关系却相对较弱。
人工智能的发展使数学与物理的这一差别更加突出。当前AI系统已经能够在经过清理、保证有解并具有明确评分标准的奥林匹克竞赛问题上达到很高水平。它们的成功说明,封闭问题中的长链推演和标准答案生成不再是人类科学能力的专属标志;但竞赛得分本身并不能证明系统已经具备在开放情境中可靠审查模型、证据和物理适用域的能力。若物理竞赛只奖励模型内部的运算,就可能使用一个越来越容易被机器占优的指标来筛选人类,反而弱化实际科学研究中真正不可缺少的问题重要性研判、模型选择和证据判断能力。
即使在数学内部,竞赛和考试也不是甄别高端人才能力的唯一途径,王虹与邓煜的成长经历提供了有启发性的对照。两人同为北京大学2007级校友,并于2026年获得菲尔兹奖 [18] 。邓煜曾获2006年国际数学奥林匹克竞赛金牌 [19] ,展示出了竞赛能够较早识别的一类卓越能力,并在大学阶段表现突出;王虹则经历了转专业、跨学科训练和较长时间的自主探索 [20-21] ,说明原创能力也可能不体现为单一早期指标而逐渐显现。这两条道路不应被标签化为谁更“适合AI时代”,更不能把任何一位科学家的创造归结为一种可替代的解题模式。它们共同表明:早期竞赛能力与长期问题探索都可能通向原创研究,成熟的人才体系必须同时容纳快速显现和缓慢成长。
对物理奥赛获奖者而言尤其如此。奖牌是高潜力信号,不是科学家资格的提前认证。选手成为研究者,还要经历从回答别人提出的问题到发现重要问题、从数小时反馈到数年不确定、从干净模型到噪声与误差、从个人排名到共同体合作的转变。跨国追踪研究 [22] 也表明,虽然选手的奥赛经历与后续专业选择和博士训练存在明显联系,但长期发展同时受到国家机会结构、教育环境、导师和国际流动的影响。选拔和培养必须一体化:发现人才之后,还要为其进入未知领域、承受失败和形成独立判断提供制度条件。
因此,对不同学科、不同阶段和不同类型的科学能力,应实行分类评价。对基础知识学习、规范训练和封闭问题求解,可以通过考试和竞赛作适度评价;对问题发现、长期探索和原创研究,则应减少频繁排名和统一量化,更多依靠长期观察、代表性工作、同行讨论和实践检验来评价。特别是在原创性尚未显现、研究方向仍在形成的阶段,制度有时不仅要“改进评价”,还应主动减少评价,甚至暂时不评价、不排序,让真正重要而尚未成熟的思想获得自由成长的时间。评价的目的应是帮助人才成长,而不是用持续考核代替培养本身。
更为重要的是,考试和竞赛的真正教育价值,不应只体现在学生能否迅速得到标准答案,还应体现在他们面对可疑前提、错误命题和权威结论时,能否保持科学的审慎、诚实与勇气。一道竞赛题若存在概念漏洞、适用条件缺失,或把近似公式外推到失效区域,它可能损害学生对科学严谨性的信任,也可能成为培养科学精神的特殊契机。关键不在于要求学生“服从答案”,而在于鼓励他们检查前提、追问尺度、辨别模型边界,并允许依据充分的质疑启动正式复核程序。对青少年而言,发现一道题有问题,往往比正确解答一道熟悉题型更接近真实科研:科学进步正是在“不相信现成结论”、重新审查证据和修正错误中发生的。人才成长不仅需要掌握知识、技巧和提高解题速度,更需要坚持求真、质疑、宽容失败、尊重证据以及敢于对权威说“不”的科学精神。命题者和组织者也应以同样的科学态度面对错误,公开说明、及时纠正,而不能为了维护竞赛权威而压制合理异议。一个成熟的人才培养制度,应把学生在错题面前表现出的独立判断,看作比奖牌更珍贵的成长佳绩:竞赛选拔的最高价值,不是训练青年适应标准答案,而是帮助他们形成发现问题、坚持真理并推动知识自我纠错的能力。
4 体制化破解竞赛价值难题的国际经验与AI时代的科学评价改革
黑洞题所暴露的“标准答案陷阱”,不只是一次命题技术问题,更是对评价制度能否识别高层次科学判断的检验。竞赛制度不可能保证题目、参考答案和评分细则永远正确,真正重要的是:错误发生后,纠错渠道是否畅通,错误成本由谁承担,以及指出问题的学生会受到奖励还是惩罚。一个只奖励“沿着题设算到底”的制度,可能筛选出熟练的求解者,却未必能够识别出敢于追问前提、检验边界并对结论负责的未来科学家。
国际竞赛中已有一些值得借鉴的纠错实践。2014年美国F=ma物理竞赛因网络评分所使用的第19题答案键有误 [23] ,原定晋级线为12.5分。由于短期内无法准确重算所有网络答卷,组织方将相关考生的晋级线降至11.25分,并明确保留考生已经取得的半决赛资格,即使考生后来校正后的分数低于原晋级线,也不撤销其资格。这一处理体现了“制度错误不应主要由学生承担”的原则。到2026年,美国物理教师协会又明确表示,F=ma首先是一项资格考试,而不是精细排名工具,晋级线附近的微小分差不能有意义地区分学生能力,因此不公布个人分数,只公布晋级名单。这既体现了纠错责任,也体现了对评价精度存在边界的承认:考试可以用于划定一个大致合格群体,却不应把一两道题、几分之差用于人才能力的精确排序。
国际数学奥林匹克采用正式的国际协调程序,由各国领队与主办方协调员共同商定每名学生的得分,如不能达成一致,争议可以逐级提交题目负责人、总协调员,直至国际评审团 [24] 。考试前,国际物理奥林匹克的国际委员会会审议题目、参考解答和评分细则,有权修改或否决存在问题的试题;考试后,各国领队可以依据学生原卷与阅卷人讨论评分,无法达成一致时由国际委员会裁决 [25] 。参考答案在这里并不是不可质疑的“终审判据”,评分本身也是一个需要证据、协商和共同负责的专业判断过程。
还有一些国际赛事已经把质疑、辩论和复核直接纳入评价体系。国际青年物理学家锦标赛(IYPT)要求学生轮流担任报告者、反方质询者和评审者:不仅要提出自己的理论模型和实验结果,还要发现他人论证中的薄弱环节,回应批评,并对报告者与质询者的表现作出评价 [26-28] 。近年来,在国内大中衔接阶段的拔尖创新人才培养中,IYPT及其背后的“探究-辩论”式育人模式获得了越来越多的关注 [29] ,并已被一些重点中学和高校引入物理学科的早期培养计划中 [30-31] 。这种基于真实物理情境的开放式研究与讨论,在打破“唯标准答案”思维、提升学生独立物理判断力方面能取得不错的效果 [32] 。Regeneron国际科学与工程大奖赛则将研究问题、方法设计、数据分析、可重复性、创造性、结果局限和现场答辩纳入综合评价,要求评委查看研究记录,判断学生的独立贡献以及对结论边界的理解。这里被评价的已经不只是“答案是否正确”,而是学生从提出问题、建立模型、获得证据到接受质疑的相对完整的科学活动表现。
不过,现有协调和申诉机制主要擅长处理题面错误、答案键错误、非标准解法和评分分歧,对于更加隐蔽的问题——题目所代表的物理模型的使用是否已经越过自身适用边界——仍显不足。面向黑洞热力学、量子信息和复杂系统等前沿或跨尺度试题,可以增加四项制度安排:(1)题面应明确模型身份、近似条件和截止尺度。若命题只是要求考生在某个形式模型内进行外推,也应明确标注“仅在给定模型内计算”等,不能把形式结果直接表述为真实物理结论。(2)答卷应设置独立的“题设审查/科学异议”区域,允许考生陈述量纲矛盾、极限反例、状态量不可定义、实验不可操作或近似失效等问题。学生不应被迫在“服从题设”与“放弃得分”之间二选一。(3)赛后应由独立于原命题组的跨领域专家进行复核,特别是涉及引力、量子理论、统计物理等多个领域的试题,不能让命题者同时成为自己错误的唯一裁判。(4)一旦科学异议成立,应启动统一重评、公开勘误和资格保护机制,不能让最早发现问题的学生独自承担举证、申诉成本和机会损失。
评价结构也可以由单一的“标准解复现”改为“模型内求解—模型外审查”的双层评分。以黑洞题为例,可采用如下示范框架:模型内求解占60分,其中物理量和基本关系识别15分,推导与计算25分,量纲及极限检查10分,形式结果解释10分;模型外审查占40分,其中识别模型适用域和失效尺度15分,提出反例、证据或文献依据10分,给出修正表述或替代模型10分,如实说明不确定性和结论局限5分。这里的60%与40%不是适用于所有试题的固定比例,而是说明对模型边界判断必须对应计分真实分值。对于成熟的基础知识题,模型内求解可以占更高比例;对于前沿、跨尺度或开放性题目,模型审查则应占据更大的计分权重。不能一方面宣称竞赛考查“物理思想”,另一方面又只给代数推演计分,而不给识别理论失效的物理判断计分。
科学家精神的考量还应成为具有实质奖励的“特别加分项”,而不应仅仅是在总评语末尾象征性地写一句“敢于质疑”。可以在常规评分之外设置0~10分的“科学异议特别分”,单列记录,并用于晋级线附近的复核、特别推荐和记入人才成长档案。这一加分不应只是无关痛痒的几分,而应当在必要时足以改变晋级结果,使科学诚实获得真实的制度回报。获得这一特别加分需要满足明确条件:异议必须指向某个具体前提、公式或推理环节,而不是笼统地表示不同意;必须能够给出公式、量纲、极限反例、文献依据或实验方案中的至少一种证据;必须能够区分“我没有算出答案”与“该问题在给定条件下没有定义”;还应说明异议成立后原结论应如何修改,或者什么问题在现有理论下仍然无法回答。对使用资料或人工智能也必须如实披露,并能够独立解释最终判断的依据。
这样的加分不是鼓励逞强、唱反调或修辞性的怀疑,而是奖励可检验的批判、坦诚的存疑以及对结论负责的勇气。学生承认“现有条件不足以得出结论”,有时比勉强拼凑一个确定答案更符合科学精神;学生指出自己的推导依赖某项尚未验证的假设,也比隐藏假设更值得肯定;学生主动修正自己前面的错误,更不应被视为能力不足,而应被视为科学诚实和自我纠错能力的表现。而且,这项加分必须足够“值钱”。如果学生已经正确指出,霍金温度、可逆热机或质量损失公式不能无条件外推至零质量附近,那么即使他拒绝顺着题意写出命题者所期待的“最终消失时间”,也不应因为没有复现参考答案而失去主要分数。相反,明知前提可疑,却为了迎合标准答案而把错误计算写到底,不应得到更高评价。制度应当保证:有证据地说出“不对”,不会比顺从地写出错误答案付出更大的代价。
科学家精神的加分,本质上是在奖励求真、诚实、质疑、证据意识和责任担当。它不是竞赛之外的道德装饰,而是科学能力本身的重要组成部分。科学研究并不是在已知规则内不断提高解答速度,而是不断追问规则从何而来、适用于何处、何时失效,以及新的证据是否要求我们修正已有认识。一个学生在竞赛中第一次发现“标准答案可能有错”,并能够以理性、克制和证据充分的方式表达出来,这本身就是一次极为珍贵的科学成长。
命题阶段还可以引入人工智能压力测试,但不能把“AI能够解出题目”本身当作坏题的证据。更合理的红队流程,是让不同系统分别扮演求解者、怀疑者和审稿人:求解者严格沿题设完成标准推演;怀疑者主动寻找隐藏假设、量纲问题、极限反例、失效尺度和文献冲突;审稿人比较两类输出并标记争议。若求解系统稳定复现参考答案,而多个审查系统又独立发现参考答案忽略了关键适用域,试题就应自动进入人工专家复核。AI在这里是扩大审题搜索范围、增加反例发现概率的工具,而不是替代命题者承担科学责任的“机器裁判”。
这种改革在AI时代更为紧迫。2025年,Google DeepMind的Gemini系统在国际数学奥林匹克六道题中完整解决五道,获得35分 [33] ,其解答由IMO协调员按照学生答案的标准评定为金牌水平。另有研究团队报告,其Physics Supernova系统在2025年国际物理奥林匹克(IPhO)理论题上得到23.5/30分 [34] ,按照当年人类选手成绩估算可以列第14名;但这属于赛后研究评测,并不是AI作为正式选手参加IPhO,二者应当严格区分。尽管如此,这些结果已经表明,在封闭、标准化、答案明确的问题上,高质量求解正在迅速自动化。
因此,AI时代的科学人才评价可以进一步形成三层结构。基础层在无AI条件下考查核心知识、量纲感、估算能力和独立推理,保证学生具有不依赖机器的认知底座;判断层允许使用资料和AI,重点考查来源核验、模型比较、幻觉识别、机器纠错和责任归属判断能力;研究层则通过数周或数月的小型课题,评价问题提出、模型构造、实验或数值验证、失败记录、合作讨论、修改过程和公开答辩能力。 国际科学展评已经开始发布学生研究中生成式AI的使用与引用指南。这提示我们,未来的重点不是简单禁止工具,而是要求工具使用可披露、可追踪、可解释,最终结论必须由学生本人理解并承担责任。所谓“批判性提示”、“模型审查”或“AI协同研究”,只有当学生能够说明机器哪里可能出错、自己依据什么作出取舍,并愿意对最终结论负责时,才属于科学能力,而不是另一种提示词技巧。
归根到底,改革不是在竞赛之外再附加一项抽象的“科学精神分”,而是要把科学精神转化为制度权利和评价权重:学生有权质疑题设,异议有正式书写空间,证据有独立复核渠道,正确纠错能够获得足以影响晋级的分数,制度失误不能主要由学生承担后果。AI可以参与求解、质疑和审稿,但最终科学责任仍必须由人类共同体承担。成熟的科学评价制度,不在于奖励研究人员给出标准答案,而在于当年轻人以充分证据指出错误时,制度能否保护他的诚实,承认自身的局限,并把这次“没有服从标准答案”的经历,转化为科学人才成长中真正重要的加分项。
5 结语与展望
这道黑洞题所揭示的,远不只是一个公式能否积分到零质量的问题,而是科学教育如何处理理论边界、未知领域与标准答案之间的关系。宏观黑洞的霍金温度具有明确的半经典意义(没有对时空进行量子化),但当质量接近普朗克尺度时,温度、准静态过程和可逆热机是否仍然成立,已经超出原有理论的受控范围。形式计算可以保留,但必须说明它只是理想模型中的数学外推,而非真实自然过程的确定结论。
AI使这一问题更加紧迫。AI正在迅速掌握封闭问题中的长链推理、公式演算和标准解复现能力,“算得快、做得对、像标准答案”将不再足以代表高水平科研能力。未来科学研究更需要对重要问题的识别、对模型适用域的判断、对证据可靠性的审查,以及在不确定条件下对结论负责。科学家精神也将更多表现为敢于质疑前提、尊重证据、承认未知、主动纠错,并在机器给出流畅而自信的答案时,仍然保持独立判断。
这迫切要求“教”与“学”同步转型。一方面,教师不能只传递成熟结论,还应引导学生探究公式从何而来、依赖哪些假设、在何处失效。在此过程中,教师可适当引入涉及前沿研究的教学内容及原始文献 [35] ,带领学生共同分析前沿模型的适用边界,勇敢踏入没有标准答案的未知领域。另一方面,学生也不能只停留于答案复现层面,而应学习如何主动提出问题、构造模型、寻找反例、核验资料,并在客观审查AI输出的过程中理解并说明结论的不确定性。通过这种双向互动,我们能在拔尖人才培养早期筑牢学生的科学基础与基本判断力,让教学目标由知识灌输和解题训练,转向科研潜能与科学精神的共同生成。
考试和竞赛仍有不可替代的基础评价作用,但必须重新划定边界。基础知识、规范推理和封闭问题可以继续通过考试加以检验,而问题发现、长期探索和原创研究则应减少频繁排名,更多依靠过程记录、代表性工作和实践检验来评价。尤其应把“模型内求解”与“模型外审查”同时纳入评分,把有证据的科学异议、主动纠错和诚实说明未知转化为真实分值与制度保护。AI可以参与命题、求解和红队审查,却不能替代人类承担科学责任。未来评价制度最重要的能力,不是激励研究人员给出标准答案,而是在标准答案出错时,能够识别并保护那个最早依据证据说出“不对”的年轻人。
附录 黑洞热力学相关的概念能否外推到零质量
核心判断: 把霍金温度公式外推到普朗克质量甚至零质量,其基本的统计结构发生了改变。对宏观黑洞,霍金辐射可以近似为由单一逆温度 β H 描述的正则热谱;随着黑洞质量减小,辐射反作用、有限热库效应和辐射之间的相关性增强,辐射态偏离正则分布。此时不存在能够描述整个辐射态的唯一正则温度,依赖两个平衡热源温度而建立的卡诺循环也就失去物理基础。
1. 具体问题是什么
这个问题源于一道关于黑洞热力学的综合题。题目把施瓦西黑洞视为具有确定温度和熵的热力学系统,并用霍金温度、贝肯斯坦—霍金熵、斯特藩—玻尔兹曼定律以及卡诺循环,讨论两个黑洞之间的可逆热机过程和单个黑洞的蒸发过程。问题主要集中在第(4)问和第(6)问。第(4)问让较小黑洞不断失去质量,最终取其质量为零,并据此计算全过程可提取的最大功;第(6)问则把半经典辐射功率一直积分到零质量,把所得时间称为黑洞“最终完全消失”的时间。
两问共同依赖一个隐藏前提:霍金温度和黑洞热力学关系在黑洞质量趋于零时仍然有效。真正需要判断的是 M →0时,辐射是否仍由单一正则温度描述?答案是否定的。进入小质量区以后,问题不再只是末期修正变大,而是“正则热谱—唯一温度—可逆热循环”这一整套逻辑链条依次失效。
2. 霍金温度的半经典适用条件
霍金温度 T H =ℏ c 3 /(8π k B GM )是在“经典引力背景上的量子场论”框架下得到的 [3,4] 。该公式将黑洞近似视为无限大热库,其物理前提是黑洞质量与视界远大于普朗克尺度( M ≫ M P , r s ≫ l P )。此时,单次典型辐射的能量占总能量极小,一次辐射不会显著改变黑洞的宏观状态,因此才能定义随时间缓慢变化的瞬时温度。当黑洞质量减小,辐射反作用与有限尺寸效应增强,辐射态必然偏离正则分布:
非热辐射谱: 黑洞辐射的更一般概率由辐射前后的微观熵 S ( U )的差决定 [7] ,即

在自然单位制( G =ℏ= c = k B =1)下,施瓦西黑洞熵为 S BH ( M )=4π M 2 。发射能量为 ω 的量子后,熵差精确值为Δ S BH = S BH ( M - ω )- S BH ( M )=-8π ω ( M - ω /2)。相应的辐射概率为

这正是Parikh-Wilczek隧穿谱 [5] ,它表明标准霍金正则热谱exp[- β H ω ]仅是 ω / M →0时的最低阶近似,而非小质量黑洞的精确分布。
辐射信息的关联: 由于非热谱的高阶修正,连续辐射事件之间存在显著的统计相关性。计算两次独立辐射与联合辐射的概率比 [6,7]

这表明黑洞辐射不能被视为由固定热库独立产生的正则量子流;能量守恒使得前一次辐射与后一次辐射之间保留了信息关联。
有限系统温度涨落与单一温度定义失效: 前沿有限系统热力学表明 [7,10,11] ,非正则态不能被改写为单一常数 β 的玻尔兹曼分布。黑洞逆温度分布的相对宽度(即涨落)为 [11,12]

当 M ≫ M P 时,温度涨落极窄,单一瞬时霍金温度是良好近似;但当 M ~ M P 时,
,不同“温度成分”的展宽与平均值达到同量级。此时,系统不再存在能够作为积分因子并表征整个平衡态的唯一“热力学温度”。
3. 竞赛题具体设问的失效分析
第(4)问(可逆热机运行至零质量): 可逆卡诺效率 η C =1- T 2 / T 1 建立在单温度热源与准静态过程的基础之上。当较小黑洞接近零质量时,其辐射显著偏离正则分布,单一热力学温度失效,因此不能强行代入卡诺效率公式计算可逆功。合理的做法是设定半经典截止质量 M c ≫ M P ,方程不可外推至 M =0。
第(6)问(蒸发时间积分至零质量): 基于黑体近似的质量损失率 d M / d t ∝-1/ M 2 积分得到的
仅能给出半经典阶段的主导时间标度。未知末期的量子引力相变或普朗克残余无法由该经典方程决定,故形式上的积分终点不能解释为真实的“完全消失”时间。
总的来说,宏观大质量下, T H 是描述霍金辐射的良好温度;但在普朗克尺度下,辐射由有限熵差决定,产生关联性并显著偏离单温度正则分布。将通常的热力学循环与连续蒸发方程直接积分至 M =0,属于系统的概念越界。若保留零质量极限,必须明确这仅是半经典公式的数学外推模型,而非对真实黑洞演化终点的物理预言。
通信作者: 卢竞,lujing@hunnu.edu.cn;马宇翰,yhma@bnu.edu.cn;孙昌璞,中国科学院院士,suncp@gscaep.ac.cn,本文第一作者、第二作者对该研究作出同等贡献。
引文格式: 卢竞,马宇翰,孙昌璞. 标准答案的边界:黑洞何以有温度——漫谈教育科技人才一体化实践中的科学精神[J]. 物理与工程,2026:网络首发.
Cite this article: LU J, MA Y H, SUN C P. The boundary of the standard answer: How can a black hole have a temperature? Reflections on the scientific spirit in the integration of education, science, and talent cultivation[J]. Physics and Engineering, 2026: online first. (in Chinese)

卢竞 ,湖南师范大学教授、博士生导师,湖南省中学生物理竞赛主教练兼领队。主持国家自然科学基金项目三项,在国际物理专业刊物上发表SCI科研论文五十余篇。从2016年开始担任湖南省中学生物理竞赛主教练的10年中,湖南队共取得5枚国际物理奥林匹克竞赛金牌,82人进入国家集训队(全国共500人),4人获得全国中学生物理竞赛决赛个人总分第一名(全国共10人)。

马宇翰 ,北京师范大学副教授、博士生导师。曾获国家“博新计划”资助,专注非平衡热力学与统计物理基本问题与应用场景的研究,在领域一流期刊以第一/通讯作者发表论文27篇(Phys. Rev. Lett. 3篇,Phys. Rev. E/A/Res. 11篇)。教学方面关注普通物理背景下基于探究性学术竞赛的创新人才培养体系及课程建设,在大学物理、物理与工程等刊物发表教学论文24篇。长期担任PT系列赛事裁判和指导教师,连续三年获评CUPT最佳裁判。课题组多名高中生入选IYPT国家队、入围丘成桐中学科学奖总决赛。

孙昌璞 , 理论物理学家 ,中国科学院院士,发展中国家科学院院士,中国工程物理研究院研究生院创院院长。曾任东北师大教授,中国科学院理论所研究员和北京大学客座讲席教授。获得过国家自然科学二等奖和美国ISI“经典引文奖”等奖励以及全国先进工作者等荣誉称号。他长期组织参与我国物理学科战略规划工作,目前是中国物理学会副理事长,国家自然科学基金委员会监督委员会副主任,并担任中国科学院哲学研究所学术委员会主任和北京大学物理学科卓越人才培养指导委员会主任。著有《量子力学现代教程》和《经典杨-Mills场理论》等。
转载本文请联系原作者获取授权,同时请注明本文来自清华大学出版社学术期刊科学网博客。 链接地址: https://blog.sciencenet.cn/blog-3534092-1553956.html
上一篇: 广西大学王开拓研究团队:面向放射性核素全链条处置,非水热法制备高强耐辐照方钠石微球及其铯锶核素一体化处置机制 欢迎参加科学网十佳博文评选活动! 主办单位:
支持单位: 