01
AI 基础设施
多 GPU 推理、请求路由、prefix cache 行为与 serving 评测。
RadixGates · SGLang · llama.cpp · Docker
宾大电子工程 M.S.E. · Queen’s 商科 + 计算机双学位
从多 GPU 推理、本地模型和系统代码,到这学期的固件与 SoC,我喜欢先把系统真正跑起来,再用实验把瓶颈、故障和取舍拆清楚。
寻找 2027 年暑期实习:AI 基础设施,或嵌入式 / 软硬件系统方向。
01
多 GPU 推理、请求路由、prefix cache 行为与 serving 评测。
RadixGates · SGLang · llama.cpp · Docker
02
C++ / Go 系统编程、并发、存储与性能测量。
cdc-chunker · 8 线程 7.4 GB/s
03
目前在宾大进一步学习裸机 C、SoC 性能剖析,以及数字 IC / VLSI。
ATmega328PB · Ultra96 · VLSI
04
PySpark / Hive 数据链路、SQL、数据质量与运行监控。
Shopee · 整合 10+ SQL 作业
推理服务
节点挂掉后,一个轻量的 Go 网关还能不能让 SGLang 集群持续对外服务?它的 prefix 路由放到真实推理引擎上还有没有用?
85.2% → 99.7% 节点崩溃测试中无错误完成的请求占比,对比原始网关(4 个模拟节点、16 个并发客户端、30 s)
相同故障注入条件下,节点崩溃场景的请求成功率由 85.2% 提升到 99.7%;测试用例增至 55 个(go test -race)。
在 3 个真实 llama.cpp 实例上,升级后的路由策略只是把 prefix cache 命中率恢复到与原版持平(61.5% 对 59.1%),并没有超越;但最忙节点的 prefill 占比从 73% 降到了 43%。
模型微调
一个用 LoRA 微调过的 0.5B 模型,能不能在笔记本上回答数据库相关问题,而且数据不出本机?
16.4% 能正常执行但返回错误结果的比例(Q4_K_M 量化,391 道留出测试题,按执行结果打分)
执行准确率从 42.7% 提升到 82.6%;但有 16.4% 的答案能执行却返回错误结果,只看字符串匹配根本发现不了。
加上护栏后,静默错误率也只降到 9.1%,仍没达到 5% 的目标线,所以结论是做成人工复核的建议工具,而不是自主作答系统。
存储
用 C++17 实现的内容定义分块(CDC)能跑多快?上了多线程之后,分块结果还能和单线程完全一致吗?
7.4 GB/s 8 线程下的吞吐,分块结果和单线程逐字节一致(256MiB 内存数据,平均块大小 8KiB,Apple M1)
单线程约 2.0 GB/s,8 线程 7.4 GB/s,输出和单线程完全一致;67 MB 源码树经 200 次编辑后,仍有 96.5% 的字节可复用。
合并 LoRA 权重后的模型文件只有 27.6% 的字节能复用——该分发的是 LoRA adapter,而不是合并后的完整模型。
工具
给定一个模型,需要几张 GPU?服务启动失败是什么原因?两次 benchmark 的结果真的可比吗?
6 项因素 我的 RTX 4090 与 A100 两组实验之间存在差异;工具会逐项标出,而不是让这次对比直接成立
2025.06 – 09
大数据开发实习生
虾皮物流网络科技有限公司(Shopee)
深圳
2025.03 – 06
数据分析实习生
Brix Technology Services
加拿大
2024.06 – 09
投资分析实习生
中信证券
中国北京
2024.03 – 06
行业研究实习生
方正证券
中国北京
实验笔记
这学期在宾大修:Smart Devices(ATmega328PB 裸机 C)、SoC 架构(在 Ultra96 上做性能剖析)、数字集成电路与 VLSI。 更多关于我 →
我正在寻找 2027 年暑期 AI 基础设施或嵌入式 / 软硬件系统方向的实习。