DeepSeek发布新一代OCR 2模型,首创图像因果推理架构
DeepSeek-AI正式开源新一代视觉语言模型DeepSeek-OCR 2。该模型搭载创新的DeepEncoder V2架构,首次赋予AI处理二维图像时的“因果推理”能力,突破了传统解析局限。新模型在保持超高压缩效率的同时实现性能跃升,仅...
标签索引 / 第 50 页
这个标签下有 609 篇文章。按时间回看相关判断与实践记录。
标签精选
DeepSeek-AI正式开源新一代视觉语言模型DeepSeek-OCR 2。该模型搭载创新的DeepEncoder V2架构,首次赋予AI处理二维图像时的“因果推理”能力,突破了传统解析局限。新模型在保持超高压缩效率的同时实现性能跃升,仅...
针对招聘季简历排版难与隐私泄露痛点,开发者推出了基于 Next.js 15 的 Markdown 简历平台 LinkCV。该工具集成了 DeepSeek 和 Gemini 模型,提供 AI 智能润色与多语言翻译。其核心亮点在于“阅后即焚”功...
本期GitHub趋势涵盖了从视频生成到AI开发的多个前沿项目。代码视频制作库Remotion登顶,AI编码整合包Goose引发关注。DeepSeek的性能优化方案、微软的Agent训练框架以及Mastra等AI应用开发框架的走红,显示出AI...
一款名为 GJavaDoc 的 IDEA 插件近日发布,旨在解决 Java 遗留项目文档缺失的痛点。该插件通过注解扫描、静态分析及上下文打包,结合本地 LLM(如 DeepSeek),能将复杂的“屎山”代码一键自动转化为可读的 Markdo...
近日,DeepSeek在技术社区Linux.do上引发热烈讨论。多名开发者和企业用户反馈,在寻找商用翻译模型时,DeepSeek展现出了极具竞争力的“性能-价格比”。用户指出,目前在市场上,模型能力优于DeepSeek的产品价格往往昂贵,而...
DeepSeek在近期更新中悄然上线了多模态能力。经用户测试,DeepSeek App及网站现已能够识别并理解图片内容,如准确辨认物体等。这一更新标志着DeepSeek从纯文本模型向图文结合的多模态AI迈进,补齐了其在视觉感知方面的短板,使...
近日有用户指出,DeepSeek 的推理模式似乎出现了回退。与此前类似 Gemini 的自信简洁风格不同,当前版本再次变得长篇大论且显得“自我怀疑”。用户反馈称,即便是简单的问题,模型也需要进行长达两分钟的冗长思考,这种变化引发了关于模型优...
本文以支持自定义API的AI狼人杀游戏为例,深入分析了当前AI创业变现的赛道现状。作者指出,AI短视频、小说出海及绘图等传统赛道已成红海,竞争激烈且利润下滑。相比之下,AI在游戏游玩过程中的应用(如跑团、剧本杀)尚未被充分重视。通过AI担任...
本文探讨了通过验证层提升浏览器Agent可靠性的方法。在亚马逊购物案例中,系统采用DeepSeek-R1作为规划器,结合小模型执行器和Sentience验证层,成功实现了端到端的自主操作。相比纯视觉方案,结构化快照与显式断言不仅将Token...
DeepSeekAI官方FlashMLA代码库出现异常动态。虽然“MODEL1”相关字段最早在1月16日就已存在,但昨天的更新中,开发者专门提交了一次修改,将这些字段彻底删除。这种“出现又删除”的操作引发了社区极大好奇,外界猜测这可能是De...