Mac mini M4 本地部署实测:Qwen3.5 借助 oMLX 并发提速最高 2.77 倍
一项针对 Mac mini M4 的基准测试显示,利用优化工具 oMLX 部署 Qwen 3.5 大模型,其并发推理性能获得了显著提升。在 Qwen 3.5-9B 模型的测试中,通过启用连续批处理技术,系统在处理 8 个并发请求时实现了最高...
标签索引 / 第 4 页
这个标签下有 57 篇文章。按时间回看相关判断与实践记录。
标签精选
一项针对 Mac mini M4 的基准测试显示,利用优化工具 oMLX 部署 Qwen 3.5 大模型,其并发推理性能获得了显著提升。在 Qwen 3.5-9B 模型的测试中,通过启用连续批处理技术,系统在处理 8 个并发请求时实现了最高...
近日,一款基于fcitx5的本地语音输入法插件在GitHub开源社区引发关注。该插件不仅实现了极速的本地语音识别,更创新性地集成了大语言模型(LLM)后处理模块,能够智能为语音转写的文本添加标点符号,解决了传统语音输入缺乏语气的痛点。尽管在...
近日,有用户发起关于“无需联网 AI 摄像头”的技术讨论,旨在解决家庭安防中的隐私痛点。该需求重点在于寻找支持本地算力的硬件,能够直接在设备端运行人形检测和动作识别模型,避免视频流上传至云端。讨论范围涵盖了具备本地 AI 能力的成品摄像头,...
V2EX 社区近期引发了关于“家用 LLM 部署”的讨论,用户展望未来能像搭建 NAS 一样,在家庭环境中轻松运行私有化大模型。这一愿景的实现取决于两大关键变量:硬件成本的显著降低(如高显存芯片普及)以及开源模型能力的全面跃升(媲美顶尖闭源...
本文基于 M4 Mac Mini 通过 Ollama 对 7 款 7B 以下参数模型进行了严谨的翻译能力实测,涵盖 5 种目标语言及 1155 条真实论坛语料。测试结果显示,3B 及以下模型响应均在 1 秒以内,足以满足实时交互需求;而腾讯...
Qwen(通义千问)正式推出3.5系列小型模型,涵盖0.8B、2B、4B和9B四个版本。该系列模型基于统一的Qwen 3.5平台构建,核心优势在于具备原生多模态能力、改进的架构以及扩展的强化学习机制。新模型针对不同场景进行了精准定位:0.8...
本教程详细介绍了如何在 Mac 端利用 LMStudio 本地部署 Qwen3.5-9B-MLX-4bit 多模态大模型。实测数据显示,在 Mac mini M4 上运行该模型,内存占用仅 7G 左右,功耗控制在 40W,生成速度约 21t...
苹果正式推出 iPhone 17e,起售价维持 599 美元,但起步存储翻倍至 256GB。核心硬件首发新一代 A19 芯片,采用 3nm 工艺,配备 16 核神经网络引擎,针对大型生成式模型和 Apple Intelligence 进行深...
苹果正式推出搭载 M4 芯片的新款 iPad Air,起售价维持 599 美元。新机性能较前代 M3 提升达 30%,标配 12GB 统一内存与更高带宽,显著增强 AI 推理能力。其 16 核神经引擎速度达到 M1 的三倍,旨在更好地支撑 ...
阿里巴巴千问团队宣布开源Qwen3.5系列的四款小尺寸模型(0.8B、2B、4B、9B),进一步完善开源生态。其中,0.8B和2B模型极致轻量,0.8B更是支持多模态,成为移动端与IoT设备的理想选择;4B模型被定位为轻量级Agent强劲基...