给Transformer浇冷水:AI大模型的“思考”或仅为统计学假象
本文回顾了AI从AlphaGo到GPT-3.5再到DeepSeek-R1的演进历程,指出强化学习虽提升了模型可用性,但也带来了“走捷径”等缺陷。作者认为,当前所谓“思考模型”的突破本质上是通过消耗更多Token来提高概率匹配的准确性,而非真...
标签索引 / 第 44 页
这个标签下有 609 篇文章。按时间回看相关判断与实践记录。
标签精选
本文回顾了AI从AlphaGo到GPT-3.5再到DeepSeek-R1的演进历程,指出强化学习虽提升了模型可用性,但也带来了“走捷径”等缺陷。作者认为,当前所谓“思考模型”的突破本质上是通过消耗更多Token来提高概率匹配的准确性,而非真...
JustSearch 是一款基于 Playwright 的开源 AI 联网搜索助手,主打“真机阅读”与自主迭代能力,彻底摆脱了对昂贵的 Search API(如 Google SerpAPI)的依赖。该项目支持 Google、Bing 等引...
社区用户实测发现,DeepSeek App新模型在长上下文处理方面表现卓越。测试者利用repomix将一个200KB的代码库上传至DeepSeek,尽管官方宣称支持100万Token(1M)上下文,但实测显示模型响应速度极快(高TPS),在...
针对DeepSeek近期支持的百万级长上下文窗口,社区开发者正在积极探索其实际落地场景。近日,一款名为“deepseek_memory”的浏览器插件在Linux.do论坛开源,旨在通过附加全局记忆信息来增强DeepSeek的对话能力。尽管目...
一位开发者分享了使用 Claude Code 开发的《幸福工厂》生产计算器项目。作为首个开源尝试,作者在开发过程中对比了 GLM-5、DeepSeek V3.2 及小米 Mimo V2FLASH 等国产大模型,发现它们在复杂编程任务上的效果...
DeepSeek 昨晚悄然更新了 API 文档,新增了一条关键注意事项。文档明确指出,目前 API 接口中的 `deepseek-chat` 和 `deepseek-reasoner` 对应的模型版本保持为 `DeepSeek-V3.2`(...
根据科技社区用户的最新讨论,DeepSeek 的新模型在不启用深度思考功能时依然表现出色。实测显示,该模型在长上下文处理能力上十分扎实,能够有效维持对话记忆,不再轻易遗忘之前的信息。更重要的是,用户普遍反映模型之前那种动不动就产生“科幻”内...
本周概览 本周AI行业两条主线:美国巨头忙着企业化变现,中国厂商密集发新模型抢市场。OpenAI推芯片计划和Codex新模型,Anthropic完成史上最大AI融资,Google砸钱扩算力。中国这边,智谱GLM-5发布、MiniMax香港上...
北京大学肖睿团队推出了一套名为“DeepSeek赋能系列”的AI实操教程资源,旨在通过系统教学普及国产大模型应用。该系列涵盖零基础AI视频制作、AI绘画大师课程,以及利用AI实现Excel数据可视化与PPT/Word高效办公。此外,课程特别...
DeepSeek 近日被用户发现模型回答语气更自然,官方随即确认正在网页端及 APP 测试全新的长文本模型架构。此次更新最引人注目的是支持高达 100 万 token(1M)的上下文窗口,显著提升了处理超长文档的能力。不过官方澄清,API ...