近日有开发者报告,在使用Google云平台Vertex AI服务调用Gemini-3-pro-preview模型时,发现流式输出出现严重延迟问题。从位于美国硅谷的基础设施发起的API调用显示,首Token延迟(TTFT)持续超过17秒,而正常情况下应低于2秒。开发者通过ping测试确认网络连接正常,排除了网络因素。测试使用Python代码调用API,请求生成200字的故事,响应时间依然超过17秒。这一问题直接影响开发者使用Google Gemini模型的体验,可能导致应用响应缓慢,影响用户体验。目前尚无明确解决方案,开发者可考虑暂时使用其他模型或调整应用策略以缓解此问题。
Vertex AI服务延迟异常:Gemini模型首Token输出超17秒
未经允许不得转载:80aj » Vertex AI服务延迟异常:Gemini模型首Token输出超17秒
相关推荐
Google AI Studio 正式支持 Google One 订阅,联网搜索 Bug 已修复
开发者陷GCP封禁风波:Vertex AI批量翻译触发风控,整个项目遭连坐封停
零成本实战:利用New API中转GCP Vertex AI额度调用Gemini大模型指南
昔日稳定不再?开发者吐槽 Vertex AI 频繁报错,Gemini API 调用遭遇限流
Gemini API重大调整:旧Key失去折扣,开发者需全面迁移至Vertex AI
Google Vertex AI 疑似触发误封,开发者使用美国VPS仍遭“位置不支持”报错
谷歌 Gemini 频繁报错遭吐槽:Vertex AI 与 API 调用现“Too Many Requests”限制
玩转Google AI Studio:开源脚本成功注入Gemini 2.5等隐藏模型