实战部署Qwen3.5-27B:vLLM参数配置差异与优化指南
随着通义千问Qwen3.5-27B模型的发布,社区在利用vLLM框架进行高性能部署时遇到了配置难题。本文针对官方文档与vLLM文档在启动命令上的不一致性进行了对比分析,重点探讨了Data Parallelism (dp)、专家并行(enab...
标签索引 / 第 118 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
随着通义千问Qwen3.5-27B模型的发布,社区在利用vLLM框架进行高性能部署时遇到了配置难题。本文针对官方文档与vLLM文档在启动命令上的不一致性进行了对比分析,重点探讨了Data Parallelism (dp)、专家并行(enab...
一位月消耗 16 亿 token 的资深 C++ 开发者在 V2EX 发帖反馈,使用 VSCode 配合 Claude Code CLI 调用 GLM API 时遭遇诡异故障。日志显示输入 Token 仅 18.8 万,远低于模型 20.2...
Qwen(通义千问)正式推出3.5系列小型模型,涵盖0.8B、2B、4B和9B四个版本。该系列模型基于统一的Qwen 3.5平台构建,核心优势在于具备原生多模态能力、改进的架构以及扩展的强化学习机制。新模型针对不同场景进行了精准定位:0.8...
本文介绍了一种极致的 AI 辅助开发工作流。作者通过 tmux 终端复用器、Markdown 规范文档以及自定义斜杠命令,成功搭建了一套能同时指挥 4 到 8 个 AI 编码代理(如 Claude Code)并行工作的系统。文章详细拆解了基...
本文记录了AI Agent工具OpenClaw在处理超长上下文时遭遇的典型技术故障。当配置开启自动记忆刷新后,随着对话进行,上下文压缩机制循环触发,最终导致Agent进入“失语”状态——虽能请求大模型且通信层正常,但不再回复用户消息。经排查...
开发者社区近日推出开源项目 cc-connect,旨在解决大模型接入即时通讯工具的痛点。该项目成功将 Claude、Codex、Gemini 等主流 AI 模型无缝接入微信和飞书,并创新性地增加了记忆系统与定时任务功能。用户仅需 10 分钟...
近日,有开发者爆料在代码提交记录中发现了名为“GPT-5.4”的神秘模型,其上下文窗口疑似高达200万tokens。这一参数如果属实,将直接超越目前Claude Code具备的100万上下文能力,且爆料中还提及了类似的“快速模式”。然而该消...
随着大模型在编程领域的应用日益成熟,传统的算法面试模式面临严峻挑战。有观点认为,当 AI 能轻易解答算法题时,人类“刷题”的必要性正在降低。相反,LeetCode 海量的高质量代码数据反而可能成为训练大模型的优质燃料,被 Anthropic...
一位非科班出身的开发者在社区发帖质疑”Vibe Coding”(氛围编程)是否为一种新型消费陷阱。帖子指出,虽然各大AI大模型提供了震撼的初体验,诱导外行用户不断订阅各类服务(如MiniX、Gemini及各类中转AP...
近期,多位用户反馈 Google AI Studio 和 Gemini Web 上的 1.5 Pro 模型出现了频繁且显著的“首字生成延迟”现象。根据社区以往的经验,这种服务端的性能波动通常是 Google 在后台进行大规模模型训练、架构微...