德国知名服务器托管商 Hetzner 正在悄然测试大语言模型(LLM)推理服务。该项目目前处于实验阶段,未开放计费且不承诺服务质量(SLA)。Hetzner 推出了一个兼容 OpenAI API 格式的端点,允许开发者直接使用 OpenAI 客户端库进行连接,目前唯一的可用模型是 Qwen/Qwen3.6-35B-A3B-FP8。这是一个包含 350 亿参数的混合专家模型(MoE),激活参数约为 30 亿,支持 262K 上下文窗口及图文多模态输入,并采用 FP8 量化权重。根据实际测试数据,该服务展现了极高的推理效率,首个 Token 生成时间中位数仅为 153 毫秒,生成速度达到每秒 224 个 Token。虽然模型在处理某些算术逻辑时表现尚可,但作者指出其并非顶尖水平。该实验的核心意义在于 Hetzner 正试图利用其在硬件采购和运营上的成本优势,进入日益商品化的开源推理市场。通过共享 GPU 容量,Hetzner 能够有效提升闲置算力的利用率。不过,目前 Hetzner 公开的 GPU 阵列主要基于工作站级显卡(如 RTX PRO 6000 Ada),在显存容量和互联带宽上限制了其对超大参数模型(如 700 亿以上参数)的支持能力,未来是否引入 B200 等数据中心级集群将是其能否成为市场关键玩家的决定性因素。
事件分析
💡 核心观点:当极致性价比的服务器巨头入局 AI 推理,意味着大模型算力正从稀缺资源加速迈向普惠的基础设施商品。
原文链接:Hacker News





