精选课程
查看全部课程最新文章
查看全部文章AMD 显卡跑语音模型的那些坑:ROCm 兼容性实录
买不起 N 卡,用 AMD 跑 Whisper、TTS、语音克隆,从驱动到 ROCm 到框架兼容,一路踩坑的记录。
向量召回率上不去?这 6 个细节我调了一周
embedding 没换、分块没动,只靠调参数和细节,召回率从 0.7 提到 0.85 的完整过程。
LLM 应用日志与监控:出了事怎么定位是哪个环节的锅
请求日志、token 统计、延迟分位、错误追踪,一套适合 LLM 应用的监控方案。
vLLM 生产部署笔记:从 PagedAttention 到 OpenAI 兼容接口
为什么吞吐比 HuggingFace 原生高那么多、KV cache 显存怎么算、以及上线前必须改的几个环境变量。
DeepSeek API 接入实战:便宜大碗,但这些坑你得知道
从拿到 key 到生产调用的完整记录,包括长上下文、JSON 模式、以及和 OpenAI 客户端不兼容的地方。