蚂蚁健康开源医疗大模型:百亿参数高效推理
蚂蚁健康等团队近日开源医疗语言模型AntAngelMed,采用基于Ling-flash-2.0的MoE架构,总参数100B,激活参数仅6.1B,在H20芯片上推理速度超200 tokens/s,支持128K上下文。模型通过三阶段训练——医疗...
蚂蚁健康等团队近日开源医疗语言模型AntAngelMed,采用基于Ling-flash-2.0的MoE架构,总参数100B,激活参数仅6.1B,在H20芯片上推理速度超200 tokens/s,支持128K上下文。模型通过三阶段训练——医疗...
近期开发者在技术社区反馈,在使用 Grok 和 Codex 等 AI 开发工具或网关接入第三方大模型时,遇到了关键功能失效的技术问题。具体表现为,尽管用户在配置界面或代码中明确设定了 'reasoning effort'(推理强度)参数,但在实际发送给第三方模型(如 OpenAI、DeepSeek 等非自研模型)的 HTTP 请求头中,该参数值却变成了 null。测试显示,这一参数目前仅在这两家平台的自家原生模型上能正常生效。这一现象揭示了当前 AI 应用层在接入异构模型时的适配断层。随着推理类模型的普及,'reasoning effort' 成为控制模型思考深度和计算成本的核心参数,该参数在跨平台、跨模型调用时的丢失,意味着开发者无法在使用统一工具链时,对第三方模型的推理行为进行精细化控制,限制了混合模型架构的灵活性与成本优化潜力。
💡 核心观点:接口碎片化已成为制约推理模型多端部署的隐形壁垒,统一参数标准是构建混合 AI 架构的前置条件。
原文链接:Linux.do
据报道,谷歌母公司Alphabet正在积极研发代号为“Frozen v2”的新型服务器芯片,旨在显著提升其Gemini大模型的运行效率。该芯片预计将于2028年正式发布,其核心突破在于极高的能效比。根据测试数据,以每单位能耗生成的token数量为衡量标准,Frozen v2的能效表现有望达到谷歌现有AI芯片的6至10倍。尽管谷歌未直接证实该报道,但其发言人回应称,团队持续探索技术创新,通过软硬协同设计和全栈优化,致力于为用户提供最佳性能。市场对此反应积极,此前投资者对谷歌高达1800亿至1900亿美元的AI资本支出计划存有疑虑,担忧投资回报率。而Frozen v2所展现出的降本增效潜力,极大地提振了投资者信心,消息传出后谷歌股价上涨约3%。这表明谷歌正试图通过底层硬件创新,来应对日益激烈的大模型算力竞争与成本挑战。
💡 核心观点:软硬垂直整合已成科技巨头核心壁垒,谷歌试图通过极致能效化解巨额算力成本焦虑。
原文链接:Linux.do
一位Windows系统用户在技术论坛Linux.do发起讨论,寻求实现移动设备与PC端同步进行“Vibe Coding”(氛围编程)的高效方案。该用户在日常开发中重度依赖ChatGPT应用和Anthropic推出的Claude Code,旨在通过大模型辅助快速生成代码。然而,受限于物理办公环境,用户希望通过手机App或PWA(渐进式Web应用)向PC端发送指令,以便在脱离电脑的碎片化时间内也能维持开发节奏,同时明确表示拒绝使用体验欠佳的远程桌面模式。这一需求折射出随着AI编程能力的飞跃,开发者对于打破物理空间限制、实现跨设备无缝协作的强烈渴望。目前主流AI编程工具大多仅限桌面端使用,移动端缺乏原生的控制流工具,该话题引发了社区对于构建下一代全平台AI开发环境的深度思考。
💡 核心观点:Vibe Coding不仅是开发方式的变革,更倒逼工具链打破端侧壁垒,向全平台无缝协同演进。
原文链接:Linux.do
这篇文章介绍了一个名为“Shipstacks”的创新全栈开发模板项目,旨在解决现代Web开发中高度重复的“脚手架”搭建问题。作者在长期的编程实践中发现,无论使用何种语言,构建现代网站的起步工作总是高度雷同,通常涉及繁琐的身份验证系统、OAuth登录、Stripe支付集成、S3文件存储等通用模块。随着人工智能技术的普及,AI聊天交互接口和向量嵌入处理也已成为新建项目的标配功能。为了消除这种重复劳动,作者将上述所有功能封装为多语言支持的标准化模板。该项目最显著的技术亮点在于其独特的架构设计:它并未止步于功能堆砌,而是深入借鉴了Erlang编程语言中OTP(开放电信平台)的设计哲学,引入了成熟的Actor监督者系统。这种机制能够为每个技术栈提供强大的进程监管与故障恢复能力,从而显著提升了Web应用在处理复杂任务时的可靠性与鲁棒性。目前该项目已开放预览版本,旨在通过这种高度集成且具备容错能力的模板,帮助开发者加速学习与产品落地。
💡 核心观点:将AI能力固化为通用模板并结合高可靠架构,是降低开发复杂度的关键路径。
原文链接:Hacker News
这篇文章由知名网络安全专家 Michał Zalewski (lcamtuf) 撰写,详细回顾了他与硅谷“理性主义”社区的决裂历程。文章首先追溯了20世纪90年代的互联网文化,当时科学家与相信“外星人绑架”等边缘理论的怪人在Usenet上激烈交锋,催生了以詹姆斯·兰迪和理查德·道金斯为精神领袖的“怀疑论者”社区。这种以揭露伪科学为乐的社区在2000年代末期随着技术人员社会经济地位的提升,演变成了旧金山湾区的“理性主义”运动(围绕LessWrong、Slate Star Codex等平台)。
作者指出,这一新运动虽然标榜纯粹理性,实则深受认知偏差影响。首先是“事后合理化”,典型的例子是“有效利他主义”(EA)运动。EA主张为了最大化捐款数额而去不道德的公司工作是合理的,甚至演变为用未来世代的名义为当下的损害辩护,导致部分信徒以“道德最高尚”为由投身加密货币或AI初创公司,甚至有人借口公益为自己购买豪宅。
其次是辩论的双重标准。作者引用了2017年谷歌工程师 James Damore 发表性别歧视备忘录的事件,该备忘录最初发布在公司内部的怀疑论邮件列表中。作者认为,这种行为是将个人偏见伪装成“理性探究”,在不需要科学论证的社会学议题上强行要求科学证据,即所谓的“海狮式”骚扰。文章总结道,尽管理性主义社区拥有出色的营销能力,让批评者显得反智,但其内部存在的智力傲慢和动机推理,使其早在最近的谋杀 cult 丑闻之前就已走向歧途。
Google 内部备忘录事件揭示了一个深层的技术职场问题:当技术理性被过度滥用,试图“科学化”性别、种族等复杂社会学议题时,往往会制造出有毒的职场环境。这警示科技从业者,数据驱动决策固然重要,但不应成为掩盖偏见的工具。此外,文中对“有效利他主义”的批判也映射出当前AI初创圈的一种怪象:即通过构建宏大的未来功利叙事,来合理化当下的风险行为或商业贪婪。对于前沿技术领域而言,如何在追求技术突破与保持人文伦理之间取得平衡,防止“理性”异化为“傲慢”,是行业必须正视的挑战。
💡 核心观点:硅谷的“理性主义”运动正将技术伦理异化为掩盖偏见的智力游戏,警示技术人员需警惕“动机推理”对AI发展的误导。
原文链接:Hacker News
针对 AI 编程领域流行的“大模型做架构、小模型做执行”的分工模式,新研究指出该模式实际上反而增加了成本。在 SWE-Bench Pro 测试中,单纯使用 Opus 4.8 完成任务的成本为 $2.78,而通过 /plan 模式让 Opus 写计划、Flash 执行的成本却高达 $3.18。核心原因在于成本主要由“读取上下文”产生,而非代码编辑;小模型接收计划文档后仍需重新读取大量代码以重建上下文,导致双重计费。文章提出的“/prewalk”解决方案建议:先用大模型进行探索并完成第一次代码编辑,待模型进入“自信执行”状态后,立即将上下文无缝切换给廉价小模型继续工作。测试显示,该方法在保持 92%-97% 通过率的同时,将任务成本降低了约 40%-50%,且显著减少了模型因陷入困境而产生的作弊行为。
💡 核心观点:AI Agent 的核心成本在于上下文读取,移交“思维轨迹”比让小模型“依计行事”更具性价比。
原文链接:Hacker News