云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本
DigitalOcean 开发者云

德国云巨头 Hetzner 试水 LLM 推理服务:以极致性价比切入 AI 基础设施

云聚 AI Token Plan 满 199 减 35 元

德国知名服务器托管商 Hetzner 正在悄然测试大语言模型(LLM)推理服务。该项目目前处于实验阶段,未开放计费且不承诺服务质量(SLA)。Hetzner 推出了一个兼容 OpenAI API 格式的端点,允许开发者直接使用 OpenAI 客户端库进行连接,目前唯一的可用模型是 Qwen/Qwen3.6-35B-A3B-FP8。这是一个包含 350 亿参数的混合专家模型(MoE),激活参数约为 30 亿,支持 262K 上下文窗口及图文多模态输入,并采用 FP8 量化权重。根据实际测试数据,该服务展现了极高的推理效率,首个 Token 生成时间中位数仅为 153 毫秒,生成速度达到每秒 224 个 Token。虽然模型在处理某些算术逻辑时表现尚可,但作者指出其并非顶尖水平。该实验的核心意义在于 Hetzner 正试图利用其在硬件采购和运营上的成本优势,进入日益商品化的开源推理市场。通过共享 GPU 容量,Hetzner 能够有效提升闲置算力的利用率。不过,目前 Hetzner 公开的 GPU 阵列主要基于工作站级显卡(如 RTX PRO 6000 Ada),在显存容量和互联带宽上限制了其对超大参数模型(如 700 亿以上参数)的支持能力,未来是否引入 B200 等数据中心级集群将是其能否成为市场关键玩家的决定性因素。

事件分析

这一事件标志着传统基础设施工具商向 AI 推理领域的实质性渗透,反映出 AI 算力服务正从高端专用需求向通用化基础设施演进。Hetzner 的核心竞争力在于其极低的运营成本结构,若能将这种“白菜价”策略成功复刻至推理市场,将对现有云厂商的定价体系构成冲击。从技术角度看,利用推理 API 整合闲置的裸金属 GPU 资源是一种高效的资源调度手段,解决了裸金属租用中“独占但未充分利用”的痛点。然而,当前受限于工作站级显卡的显存与互联带宽,Hetzner 仅能承载中小规模模型。这表明该服务目前更侧重于验证市场需求和调度系统,而非直接对标顶级超算中心。若未来 Hetzner 引入高性能互联的集群卡,其凭借欧洲数据中心的优势,极有可能成为开源模型托管的重要搅局者。

💡 核心观点:当极致性价比的服务器巨头入局 AI 推理,意味着大模型算力正从稀缺资源加速迈向普惠的基础设施商品。

阿里云 OPC 一人公司创业装备库

原文链接:Hacker News

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 德国云巨头 Hetzner 试水 LLM 推理服务:以极致性价比切入 AI 基础设施
赞助推荐 FoxCode Claude Code 稳定中转
阿里云函数计算 一键部署 AI 大模型

GLM Claude Code · 国产平替不封号

官方 Claude Code 又涨价又要 KYC,封号还得重配环境?智谱 GLM 兼容 Claude Code,稳定不封号、价格友好,注册后把现有 Claude Code 工作流直接切过来继续用。

立即体验 GLM查看套餐价格