有开发者实测发现,Gemini 3.1 Pro 在处理约 20 万字符的长文翻译任务时表现不佳,出现严重的幻觉和 Token 重复现象。尽管宣称支持 1M 上下文,但其在仅完成约五分之一任务时便开始“胡言乱语”,推测有效上下文可能仅在 200k 左右。相比之下,DeepSeek 的 1M 版本在长文本能力上表现更佳,引发了对大模型“有效上下文”与宣传参数之间差距的广泛讨论。
Gemini 3.1 Pro 长文本实测翻车:百万级上下文频现幻觉,被指不如 DeepSeek
相关推荐
AI Agent 入门课: 用 DeepSeek Harness 学五层工程能力
DSH MCP Manager 配置指南: OAuth、stdio 与工作区隔离
火山方舟 Coding Plan 实测:搭配 Claude Code 的省钱工作流
大模型周刊 第 36 期:监管给前沿模型踩刹车,开源在 token 榜上接力
1M 上下文已经可用: Claude、Gemini 与编程 Agent 怎么选
大模型选型指南 2026:Claude/GPT/Gemini/Grok/DeepSeek 怎么选
Agent 上不了网,却告诉你它查过
Google I/O 2026 的真正主线:不是模型大战,而是 Google 把 Gemini 变成生态内核