DeepSeek发布mHC架构,提升AI训练稳定性
中国AI初创公司DeepSeek于2026年初发布技术论文,介绍流形约束超连接(mHC)深度学习架构。该架构解决了神经网络规模扩大时的训练不稳定性和可扩展性问题,由创始人梁文锋团队研发,声称提供切实的性能改进和卓越的可扩展性。业内观察人士认...
标签索引 / 第 119 页
这个标签下有 1711 篇文章。按时间回看相关判断与实践记录。
标签精选
中国AI初创公司DeepSeek于2026年初发布技术论文,介绍流形约束超连接(mHC)深度学习架构。该架构解决了神经网络规模扩大时的训练不稳定性和可扩展性问题,由创始人梁文锋团队研发,声称提供切实的性能改进和卓越的可扩展性。业内观察人士认...
用户通过minimax-2.1内测,成功实现了一个幸运大转盘抽奖系统,提供了完整的HTML、CSS和JavaScript源代码。该AI模型能够处理复杂的动态网页交互任务,包括Canvas绘图、旋转算法和随机逻辑,展现了强大的编程能力。测试结...
本文深入探讨了企业内部AI代理的构建策略,对比了代码驱动与LLM驱动工作流的差异。作者详细分析了两种方法在性能、成本、可扩展性和维护性方面的优缺点,并通过实际案例展示了不同场景下的适用性。文章强调,选择合适的工作流需要考虑业务需求、技术栈和...
韩国科学技术部联合五家公司启动国家级AI项目,通过宽松许可协议发布自主研发的大模型,扩展国内生态系统。项目引入每六个月评估的生存机制,最终仅两团队获长期支持,目标2027年跃升全球AI三强。五模型计划2026年发布,包括SK Telecom...
DeepSeek团队近日发布了新论文mHC: Manifold-Constrained Hyper-Connections,该研究扩展了AI模型中的残差连接范式。通过扩大残差流宽度和多样化连接模式,mHC技术旨在优化模型性能,可能推动AI架...
本文深入解析Codex上下文窗口的272k显示值,揭示其与OpenAI GPT-5模型400k总上下文窗口的本质区别。272k实际为输入token的预算上限,而非总窗口;同时澄清了/status命令中的token使用统计与上下文窗口无关,并...
2025年,大语言模型领域经历了关键事件。知名程序员罗布·派克(Go语言联合创始人)遭遇AI生成的垃圾邮件骚扰,主题为“善意行为”,暴露了AI伦理漏洞;同时,Claude Code推出新功能,支持从代码中提取详细转录,提升开发效率。这些事件...
卡内基梅隆大学教授Austin Henley分享了他取消出版合同的亲身经历。原本计划写一本关于经典编程项目的书籍,但出版过程充满挑战:编辑不断催稿,要求融入AI内容,与他的主题冲突;合同条款苛刻,预付款和版税低;加上个人生活压力,他最终选择...
本文深度解析Atlassian Rovo Dev CLI,一款AI驱动的终端副驾驶工具。涵盖其定义、安装配置、交互式使用、核心工作流如代码分析、任务完成,以及高级功能如自适应记忆和MCP扩展。同时指出其Beta阶段的局限,如稳定性问题和强依...
一位拥有13年Java开发经验的39岁开发者,近日萌生转型AI大模型开发的念头。他已系统学习机器学习、深度学习、Transformer等核心技术,虽感门槛高但充满探索热情。针对转型可行性、常见陷阱及学习路径,他向行业前辈寻求真实建议。这一经...