笔记
一次测量教会了我什么
每篇只讲一件事。表格、原始数据和各项限制,都在它们所链接的仓库里。
-
模拟测试看不见缓存
网关的故障测试全部通过,但我加的一条路由规则,在真实引擎上还是把 prefix cache 命中率从 59.1% 拉低到了 24.4%。
-
不报错的错误答案
微调后的 0.5B 模型写对 SQL 的比例是 82.6%。真正让我担心的是另外那 16.4%:能正常执行,返回的却是错误的结果。
-
权重相同,dtype 不同
微调模型只有 27.6% 的字节和基础模型一致,起决定作用的是 dtype 编码,而不是分块器。
-
平均块大小并不等于一次修改的代价
一次修改更可能落在大块里,所以块大小的分布和它的平均值同样重要。