Zhonghui

论文阅读:FlexInfer
Breaking Memory Constraint via Flexible and Efficient Offloading for On-Device LLM Inference
3792 字
|
19 分钟
论文阅读:HeadInfer
Memory-Efficient LLM Inference by Head-wise Offloading
3301 字
|
17 分钟
PyTorch张量操作
2026-07-09
张量是一个多维数据容器,可以理解为向量和矩阵向更高维度的自然扩展
3154 字
|
16 分钟
C++完美转发
Perfect Forwarding
4767 字
|
24 分钟
论文阅读:TightLLM
Maximizing Throughput for LLM Inference via Adaptive Offloading Policy
5235 字
|
26 分钟
PyTorch Compile 3:后端
使用TorchInductor做融合、调度和代码生成
3718 字
|
19 分钟
山鬼
迟到的端午安康
3742 字
|
19 分钟
PyTorch Compile 2:前端
使用TorchDynamo做抓图
3726 字
|
19 分钟