边缘计算
LLM 在边缘设备的量化部署
利用 GPTQ 和 AWQ 将 7B 模型压缩至 4-bit,在 Jetson Orin 上达到 15 token/s。
< 构建未来 > 将想象编译为现实。专注于 AI 推理、Web3 与交互式视觉。
武汉 · 光谷 | 开源贡献者
利用 GPTQ 和 AWQ 将 7B 模型压缩至 4-bit,在 Jetson Orin 上达到 15 token/s。
从 Gas 费用、最终性、开发复杂度三个维度剖析,附 Rust 实现片段。
结合 diff-gaussian-rasterization 实现 4K 场景交互,并优化显存占用。
构建可插拔的 Agent 工作流,实现自动化数据分析与报告生成。