技术方向
长期接触 Linux、GPU、HPC 集群和 AI Infra。下面是经常写到的方向,用来说明经验和能力范围,不是服务目录。
HPC 与科研计算
长期接触科研计算软件的源码编译、模块环境和作业提交。这里写的是现场踩过的坑,不是安装包分发。
例如:toolchain 编完后 DBCSR 对不上、并行 make 漏目标、作业里栈空间不够
GPU / CUDA
驱动能看见卡,不等于当前 PyTorch 或应用轮子带了这张卡的架构。笔记按可复现的命令写。
例如:RTX 5090 缺 sm_120、Toolkit / runtime / 应用自带 CUDA 三套对不上
AI Infra / 大模型部署
写本机或机房里的驱动、推理服务和 WebUI 怎么串起来。不卖卡,也不介绍平台产品。
例如:vLLM / Ollama 起不来、多卡配不对、Open WebUI 连不上
服务器与集群排障
从报错、环境和已试过的步骤出发,把排查过程写成可复用的复盘,而不是工单话术。
例如:节点异常、驱动升级后失效、模块环境乱导致作业起不来