Grok 4.20 Beta 惊艳实测:精准识别模型参数,主动溯源原始论文
近日,科技社区 Linux.do 有用户分享了 Grok 4.20 Beta 的实测表现。在测试中,用户仅要求查询表格中开源模型的参数规模,Grok 不仅准确识别了所有模型的参数量,更令人惊喜的是,它在未被明确指示的情况下,主动挖掘出了该表...
标签索引 / 第 135 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
近日,科技社区 Linux.do 有用户分享了 Grok 4.20 Beta 的实测表现。在测试中,用户仅要求查询表格中开源模型的参数规模,Grok 不仅准确识别了所有模型的参数量,更令人惊喜的是,它在未被明确指示的情况下,主动挖掘出了该表...
据科技社区用户反馈,Grok最新版本在搜索能力上取得重大突破,其引入的Multi-Agent(多智能体)协同能力备受瞩目。实测显示,新版Grok在处理复杂搜索任务时速度更快、准确率显著提高,能够一次性解决此前GPT-4思维链模型及其他大模型...
本文深刻剖析了在AI大模型(LLM)席卷行业的背景下,资深程序员所面临的群体性文化危机。作者感叹,编程文化已从对逻辑与技艺的追求,异化为追逐“资本效率”或依赖AI生成的“赌博式”开发。这种转变导致注重工匠精神的开发者感到被边缘化,并最终失去...
The AGENTS.md Paradox: Why Our Best Intentions Are Making Us Worse 昨天 Hacker News 上的一篇新论文(arxiv 2602.11988)在 Moltbook 上引...
近日,有技术开发者在社区探讨利用AI续写《怪物大师》等长篇小说的可行性。面对前22册海量文本,直接投喂受限于大模型上下文窗口,难以保证人物与剧情的连贯性。作者提出了构建RAG(检索增强生成)知识库的解决思路,但也坦言实施门槛较高。这一讨论折...
针对开发者在调用大模型 API 时遇到的调试难题,作者开源了一款名为 PrismCat 的透明代理工具。该工具通过将 API 请求指向本地地址,无感记录所有请求与响应细节,并提供 UI 界面进行可视化复盘。其核心亮点包括智能折叠 Base6...
英伟达提出了一项名为动态内存稀疏化(DMS)的新技术,旨在解决大模型在进行长链思考时的内存瓶颈问题。通过高效压缩键值(KV)缓存,该技术在仅用1000步训练的情况下实现了高达80%的压缩率。实验表明,DMS允许模型在相同计算预算下生成更多T...
针对网文断更痛点,本文探讨了利用现有大模型(LLM)续写百万字长篇网络小说的可行性。作者尝试将百万字原著压缩为万字剧情和人物设定作为Prompt,试图解决模型的上下文记忆限制。实测发现,尽管AI能勉强维持基本的剧情连贯性,但在面对如《龙族》...
近期,许多安全从业者在尝试利用 ChatGPT、Gemini 等 AI 辅助渗透测试工作时,频频遭遇“拒绝回答”的窘境。由于主流大模型的安全护栏过于敏感,将合法的防御性安全研究误判为“恶意攻击”,导致 AI 无法发挥应有的辅助作用。这一现象...
当前主流观点认为,为AI编程智能体提供额外的上下文文件(如AGENTS.md)能帮助其理解代码库从而提升性能。然而,最新一项针对SWE-bench及真实项目的研究得出了令人意外的结论:添加这类上下文文件反而会导致任务完成率下降,并推高超过2...