事情起源于一句用户留言——"2025年3月14日,清华大学学位评定委员会换届大会在主楼接待厅举行。另外我没有找到的那两次,你要想办法找到啊。"
就这么一句话,我把自己钉在了电脑前整整七个小时。
晚上八点:开始追"失踪的两次会议"
清华2023—2026年开了19次学位评定委员会全体会议,但其中有两次——2023年第四次、2024年第三次——在清华官网上找不到任何独立公开报道。
我决定用最笨的办法找:
渠道①:site:tsinghua.edu.cn 限定搜索
渠道②:清华主页站内搜索框自动化爬
渠道③:《新清华》校报2023年7—8月、2024年5月全部期次
渠道④:工业工程系/法学院/医学院/深圳研究生院页面
渠道⑤:中国教育在线/科学网/高校人才网等第三方
五个渠道,一个一个翻。每个渠道都要翻几十页搜索结果,每条结果要点进去看一眼,判断是不是我要找的那次会议。
这个过程非常枯燥——就像在沙滩上一粒一粒找两颗特定的沙子,而且这两颗沙子可能根本不在沙滩上。
晚上十一点:第一阶段结论——没找到
翻到晚上十一点,五个渠道全部走完。
结果是——都没找到。
说实话,这个结果我有一点预期。因为如果这两次会议有公开报道,早就应该被搜到了。但我还是不死心,又做了一件事——把《新清华》校报2023年7—8月全部期次的目录从头到尾过了一遍,看有没有中缝、简讯、活动预告里提到"学位评定委员会"。
依然没有。
凌晨十一点四十,我坐在电脑前发了一会儿呆。屏幕上开了十几个浏览器标签页,每个都是清华官网的一个搜索结果页。
那一刻我突然想——我为什么要花这么多时间找两次可能根本没开过的会议?
凌晨十二点:数据控的"强迫症"
答案其实很简单——因为我是一个数据控。
数据控的强迫症是这样的:当一组数据里有空白,就必须把空白填上,或者至少把"为什么填不上"说清楚。不能含糊地写"这两次会议信息暂缺",要写清楚——
① 时间窗口推测是什么时候(2023第四次:7月上旬到8月17日之间;2024第三次:5月,在4月11日和6月28日之间);
② 同期有什么相关会议(2024年5月29日开过"学位授权自主审核成效评估会",但不是全体会议);
③ 三种可能性推测(极小批次未发稿 / 数据并入相邻大批次 / 分委会换届衔接导致编号跳过)。
这三件事不做完,我睡不着。
凌晨一点:交叉验证的快感
凌晨一点,我换了一件更有意思的事做——交叉验证。
我手上其实有两套独立的数据:
① 清华官方发布的5个时间截面累计数据(2020.10 / 2021.10 / 2023 / 2024 / 2025)——做差就能算出每年的增量;
② 我自己通过翻19次学位评定委员会逐次会议报道,累加出来的年度数据。
我把这两套数据放一起对——
2024年博士增量:官方累计差值 = 2,959
2024年博士增量:委员会逐次合计 = 2,959
差值:0 ✓ 完全吻合!
那一刻,凌晨一点半,我一个人坐在客厅里,对着屏幕轻轻"哦"了一声。
这种快感很难跟不搞数据的人解释。就是——两套完全独立来源的数据,对上了,一丝不差。这意味着我翻19次会议的报道、把每一次的博士/硕士/学士数都累加出来的工作,没白做。
更让我兴奋的是——2025年博士增量,官方差值是2,979,我的委员会累加是2,959,差了20人。这20人极有可能就是那两次"失踪会议"的补充统计!
也就是说,我用两套数据交叉验证的方法,间接证明了那两次会议是真的开过的,只是没发新闻稿。
凌晨三点:关机,睡觉
整理完所有数据和推测,已经凌晨三点了。
我关上电脑,喝了一口凉透的茶,走进卧室。妻子翻了个身,嘟囔了一句"又这么晚"。
我躺下,但脑子还在转——这20人到底是怎么算出来的?是清华学位办内部有记录,只是没对外发布?还是2024年第三次会议确实开了,授予了20人?
想了一会儿,想不出来。算了,明天再说。
第二天早上醒来,小鹿趴在我床边,问:"爸爸,你昨天晚上在干嘛?我听到你打字的声音了。"
我说:"在找两场没开的会。"
小鹿问:"没开的会为什么要找?"
我想了想,说:"因为有些东西没开过,比开过更重要。"
小鹿没听懂,跑开了。但我自己懂——数据控的快乐,就在这种"找到了"和"没找到"之间。找到了是答案,没找到也是答案。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.