何雨宸 EN

宾大电子工程 M.S.E. · Queen’s 商科 + 计算机双学位

我做 AI 模型背后的系统,也在继续往软硬件交界处走。

从多 GPU 推理、本地模型和系统代码,到这学期的固件与 SoC,我喜欢先把系统真正跑起来,再用实验把瓶颈、故障和取舍拆清楚。

寻找 2027 年暑期实习:AI 基础设施,或嵌入式 / 软硬件系统方向。

在 GitHub 上看代码 邮件联系

一条看似无害的规则

原版按 hash % N 分配,满了就排队59.1%
满载溢出升级的第一条规则24.4%
放置 + 等待最终方案61.5%
轮询不经过网关22.0%
三个 llama.cpp 实例跑在同一台 Apple M1 上,120 次请求复用六条共享 prompt,缓存容量卡在槽位数,取 3 次运行的中位数。

能力重点

01

AI 基础设施

多 GPU 推理、请求路由、prefix cache 行为与 serving 评测。

RadixGates · SGLang · llama.cpp · Docker

02

系统与性能

C++ / Go 系统编程、并发、存储与性能测量。

cdc-chunker · 8 线程 7.4 GB/s

03

嵌入式 / 软硬件

目前在宾大进一步学习裸机 C、SoC 性能剖析,以及数字 IC / VLSI。

ATmega328PB · Ultra96 · VLSI

04

数据工程

PySpark / Hive 数据链路、SQL、数据质量与运行监控。

Shopee · 整合 10+ SQL 作业

代表项目

  1. 模型微调

    llm-finetune-lab

    一个用 LoRA 微调过的 0.5B 模型,能不能在笔记本上回答数据库相关问题,而且数据不出本机?

    16.4% 能正常执行但返回错误结果的比例(Q4_K_M 量化,391 道留出测试题,按执行结果打分)

    PyTorchPEFTDDPllama.cppSQLite

    看实测数据
    实测

    执行准确率从 42.7% 提升到 82.6%;但有 16.4% 的答案能执行却返回错误结果,只看字符串匹配根本发现不了。

    判断

    加上护栏后,静默错误率也只降到 9.1%,仍没达到 5% 的目标线,所以结论是做成人工复核的建议工具,而不是自主作答系统。

  2. 存储

    cdc-chunker

    用 C++17 实现的内容定义分块(CDC)能跑多快?上了多线程之后,分块结果还能和单线程完全一致吗?

    7.4 GB/s 8 线程下的吞吐,分块结果和单线程逐字节一致(256MiB 内存数据,平均块大小 8KiB,Apple M1)

    C++17CMakeGitHub Actions

    看实测数据
    实测

    单线程约 2.0 GB/s,8 线程 7.4 GB/s,输出和单线程完全一致;67 MB 源码树经 200 次编辑后,仍有 96.5% 的字节可复用。

    判断

    合并 LoRA 权重后的模型文件只有 27.6% 的字节能复用——该分发的是 LoRA adapter,而不是合并后的完整模型。

  3. 工具

    llm-serving-eval-kit

    给定一个模型,需要几张 GPU?服务启动失败是什么原因?两次 benchmark 的结果真的可比吗?

    6 项因素 我的 RTX 4090 与 A100 两组实验之间存在差异;工具会逐项标出,而不是让这次对比直接成立

    Python

实习经历

2025.06 – 09

大数据开发实习生

虾皮物流网络科技有限公司(Shopee)

深圳

  • 将 10+ 个独立 SQL 作业整合为基于依赖调度的 PySpark / Spark SQL(Hive)批处理链路,统一增量与全量快照的处理模式,端到端耗时降低约 40%。
  • 统一算法侧与区域侧的预测数据表结构,整合为“一次计算、多方复用”的数据模型;通过分区与谓词下推,单次查询扫描数据量减少约 60%。
  • 搭建按 WMAPE 对比模型版本的看板,并配套空值率、数据量波动、时效性等自动化校验;与算法、运营团队联合排查链路和数据异常。

2025.03 – 06

数据分析实习生

Brix Technology Services

加拿大

  • 为 1 万多条案件记录搭建 Excel VBA + Power Query 分析流程:按规则去重、识别案件处于 open / closed / reopened 哪种状态、自动汇总,报告效率提升约 25%。
  • 用 MySQL 分析 1,000 多家门店三年的销售数据,找出季节性规律和毛利高峰,并用 Power BI 做出按门店、供应商、经理拆分的看板。

2024.06 – 09

投资分析实习生

中信证券

中国北京

  • 参与 IPO 尽职调查、估值材料和信息披露核查;这段经历让我养成了每个结论都回到原始材料核对的习惯,现在写技术实验报告时也一样。

2024.03 – 06

行业研究实习生

方正证券

中国北京

  • 把行业、市场和 ESG 研究里重复出现的部分做成可刷新的 Power Query 和 VBA 工作流——发现自己搭工具跟做分析本身一样投入。
  • 整合多来源的财务与市场数据,做 KPI 对标和趋势分析;用 Wind 数据做多期财务建模,测算 ROE、利润率结构和杠杆率。

实验笔记

笔记

  1. 01

    模拟测试看不见缓存

    网关的故障测试全部通过,但我加的一条路由规则,在真实引擎上还是把 prefix cache 命中率从 59.1% 拉低到了 24.4%。

    阅读全文 →
  2. 02

    不报错的错误答案

    微调后的 0.5B 模型写对 SQL 的比例是 82.6%。真正让我担心的是另外那 16.4%:能正常执行,返回的却是错误的结果。

    阅读全文 →
  3. 03

    权重相同,dtype 不同

    微调模型只有 27.6% 的字节和基础模型一致,起决定作用的是 dtype 编码,而不是分块器。

    阅读全文 →
  4. 04

    平均块大小并不等于一次修改的代价

    一次修改更可能落在大块里,所以块大小的分布和它的平均值同样重要。

    阅读全文 →

现在

这学期在宾大修:Smart Devices(ATmega328PB 裸机 C)、SoC 架构(在 Ultra96 上做性能剖析)、数字集成电路与 VLSI。 更多关于我 →

如果你也在做这些系统,欢迎聊聊。

我正在寻找 2027 年暑期 AI 基础设施或嵌入式 / 软硬件系统方向的实习。