DeepSeek-V4.1-Flash on A100 (sm80)
github.com
在 A100 上运行 DeepSeek-V4.1-Flash 的自定义推理运行时,支持百万 token 预填充与前缀复用。
可自部署DeepSeek本地模型Linux
GitHub ★ 63被推荐 1 次
适合做什么
适合在 A100 服务器上本地部署 DeepSeek-V4.1-Flash 的工程师,用于长上下文与 Agent 编程推理。
标签与属性
同类推荐
高吞吐、省显存的开源 LLM 推理与服务引擎,支持 PagedAttention 与 OpenAI 兼容 API。
开源有 API可自部署DeepSeek通义千问
github.com1 处推荐
本地部署 / 运行最流行的开源大模型本地运行工具,一条命令即可下载并运行 Llama、Qwen、DeepSeek 等模型。
开源可自部署有 API通义千问DeepSeek
ollama.com3 处推荐
OpenAI Whisper 语音识别模型的 C/C++ 高性能移植版,无依赖、可离线本地运行
开源可自部署本地模型MacWindows
github.com2 处推荐
开源本地大模型桌面应用,支持文本、视觉、工具调用,兼容 OpenAI/Anthropic API,完全离线隐私。
开源可自部署有 API支持 MCP多模态
github.com1 处推荐
Hugging Face 官方 JS 库,让 Transformers 模型直接在浏览器里运行,无需服务器。
开源多模态可自部署本地模型网页
github.com1 处推荐