人还是机器?
Team 27 为课内 Kaggle 竞赛做的检测器:在每个词都被换成数字编号的情况下,判断一段文字出自人还是模型。如今复活成实验室,原始权重在浏览器里实时给文本打分,另有类别不平衡沙盒和无泄漏的重新评估。
- 我的角色
- 与 Yifei Du、Huihui He 组成 Team 27。我负责 MPI 预处理和 CNN 实验,与 Yifei 一起做词袋特征,并与两位一起完成 SMOTE 与欠采样的比较;Yifei 负责 SVM 和 SGD 模型,Huihui 负责逻辑回归和词向量。2026 年的复活版由我搭建。
- 团队
- Yifei Du 和 Huihui He
亮点
- ·一次性导出六个原始检测器的权重,在浏览器里打分;全部 6,000 个测试预测(六个模型各 1,000 条文本)与 2023 年的文件一致。
- ·交互式检测器把人写和机器生成的词编号分布混合成样本,实时显示哪些词编号把结果推向哪一边。
- ·2026 年复查发现,2023 年的验证集混入了重复的机器文本,存在泄漏。在干净的划分上重新拟合后,domain 1 的检测器依然能较好地区分两类,但只看文本长度的基线也相差不远;两者都附 95% 区间。
- ·类别不平衡沙盒比较 SMOTE 与随机欠采样,并揭示 notebook 里的 SMOTE 步骤实际做了什么;实验日志记录了组会、尝试过的方法和每一次排行榜提交。
- 原版
- Python · Jupyter · scikit-learn · imbalanced-learn · PyTorch · mpi4py · pandas
- 2026 复活版
- 通用技术栈
技能
- 基于匿名词编号的词袋特征
- 逻辑回归与线性 SVM(SGD)
- 类别不平衡处理:SMOTE 与随机欠采样
- 把计数向量当作图像的 CNN 实验(ResNet、ShuffleNet)
- 无泄漏的留出集重新评估
- 带区间的校准、AUC 与配对检验
- 导出模型权重,在浏览器端打分
Social Sense 社媒情绪看板
Team 57 的云计算项目:给 240 万条带地理标签的推文和 170 万条 Mastodon 帖子打情感分,再和官方收入、犯罪数据对照。复活版是一个只读网站,有地图、联动图表和可复现的数据管线。
- 我的角色
- 在 Team 57 负责 React 前端,同时参与数据处理和 API 工具开发;2026 年的复活版由我搭建。
- 团队
- Xuan Wang、Wei Zhao、Zongchao Xie 和 Runqiu Fei
亮点
- ·在留存的数据上重跑团队原来的 Python 代码,对照 2023 年看板做了 18 项一致性检查,最终得到一个 1.7 MB 的只读 SQLite 数据库。
- ·把 NLTK 的分词、WordNet 词形还原和 VADER 移植成 TypeScript,在 44,156 条真实 Mastodon 帖子上与原 Python 结果零差异。
- ·补充不确定性和空间统计:各区域的 t 区间、Moran's I 与 LISA 聚类图,并屏蔽推文少于 30 条的区域。两个主要关系都与“无关联”一致。
- ·可选的自然语言转 SQL:用访客自己的 key 生成查询,由服务器校验后只读执行,回答必须引用数据行;另有 16 题评测集衡量执行准确率。
- 原版
- Python · mpi4py · NLTK (VADER) · Flask · React 18 · Plotly · CouchDB · Ansible · Docker Swarm · Melbourne Research Cloud
- 2026 复活版
- 通用技术栈 + MapLibre GL · SQLite (libSQL) · node-sql-parser · Web Workers · zod
技能
- 基于 VADER 的情感分析
- MPI 数据处理
- CouchDB MapReduce 视图
- 空间自相关(Moran's I、LISA)
- 带 HC3 稳健标准误的 OLS
- Bootstrap 区间
- 小区域数据屏蔽
- 带服务器端校验的自然语言转 SQL
- LLM 评测(执行准确率、精确 McNemar 检验)
- BYOK AI 审计日志
多臂老虎机实验室
统计机器学习课的个人项目:能应对延迟或丢失反馈的逐次淘汰(successive elimination)算法、Thompson 采样和 Doubly-Adaptive Thompson Sampling,2023 年通过回放 30 万条真实新闻点击日志来评估。如今复活成浏览器里的实验室,算法在带种子的合成日志上比拼,可以调整延迟分布,让最多七个算法同场比较。
- 我的角色
- 个人项目。原始 notebook 和 2026 年的复活版都由我完成。
亮点
- ·把五个算法逐行移植成在 Web Worker 中运行的 TypeScript,并精确复现 NumPy 的 PCG64 生成器、ziggurat 正态抽样和成对求和,浏览器打印的结果与 notebook 分毫不差。
- ·原 notebook 每个算法只跑一次;现在每个算法用 20 次带种子的重复回放,给出 bootstrap 区间、与 Thompson 采样的配对比较、效应量和延迟敏感性热力图。
- ·访客可以按臂设置 Pareto 延迟、丢包和随奖励变化的延迟,再逐帧查看每个算法内部的置信界、淘汰过程和后验抽样。
- ·可选的 BYOK 实验让语言模型来选臂,在相同种子下与 Thompson 采样和 UCB1 比较,每次调用都写入可导出的审计日志。
- 原版
- Python · NumPy · SciPy · Matplotlib · Jupyter
- 2026 复活版
- 通用技术栈 + Web Workers · WebAssembly · KaTeX · zod · Anthropic SDK
技能
- 延迟反馈下的逐次淘汰算法
- 高斯先验的 Thompson 采样
- Doubly-Adaptive Thompson Sampling
- 带延迟奖励的离线回放评估
- 逐位一致地移植 NumPy 的 PCG64 生成器
- 基于带种子重复实验的 bootstrap 区间
- 配对比较与效应量
- LLM 作为策略的评测
- BYOK AI 与本地审计日志
GLM 演练场
三份广义线性模型作业,如今复活成六个交互案例:逻辑回归、对数线性、多项、比例优势和 GEE 模型都在浏览器里实时重新拟合,并对照我 2023 年提交的 R 代码核对。
- 我的角色
- 个人作业。原始 R Markdown 分析和 2026 年的复活版都由我完成。
亮点
- ·用约 1,300 行无依赖的 TypeScript 重新实现 glm、nnet::multinom、MASS::polr 和 geepack::geeglm;49 项一致性检查把结果与 R 的输出对齐,误差通常在 1e-9 以内。
- ·每个案例都可以改动输入,当场重算估计值、区间和检验,从甲虫剂量反应实验到呈现辛普森悖论的三维列联表。
- ·补上了作业没有要求的模型检验:模拟残差包络、影响点、过度离散、轮廓似然区间、比例优势检验和 GEE 敏感性分析,所有模拟都固定随机种子。2023 年报告里的笔误与重算后的数值并排列出。
- ·可选的 BYOK 解读只依据每页的数值摘要来解释,会标出无法溯源的数字,并保存可导出的审计日志。作业 1 的调查数据较为敏感,只以模型摘要的形式出现。
- 原版
- R · R Markdown · nnet · MASS · geepack · ggplot2
- 2026 复活版
- 通用技术栈 + KaTeX · zod
技能
- 逻辑回归与二项 GLM(剂量反应、LD50)
- 列联表的 Poisson 对数线性模型
- 多项 logit 与比例优势模型
- 带稳健三明治标准误的 GEE
- 逐步模型选择与偏差分析
- 模拟残差包络与影响点诊断
- 把 IRLS 与 Newton-Raphson 拟合移植成 TypeScript
- 带数字自动核查的 BYOK 解读
技能