极客DIY:利用手机LCD打造可编程“数字虹膜”,重塑光学成像
该项目展示了一种极具创意的硬件改造方案,创作者通过回收旧手机的透射式LCD屏幕,将其改造为可编程的“数字虹膜”装置,并适配于单反镜头与无反机身之间。这块LCD不仅替代了传统的机械光圈,更能在纯物理光路中插入数字特效。该装置成功实现了机内视差...
该项目展示了一种极具创意的硬件改造方案,创作者通过回收旧手机的透射式LCD屏幕,将其改造为可编程的“数字虹膜”装置,并适配于单反镜头与无反机身之间。这块LCD不仅替代了传统的机械光圈,更能在纯物理光路中插入数字特效。该装置成功实现了机内视差...
OpenAI 当地时间周四宣布对其桌面版 ChatGPT 应用进行重大更新,正式引入了备受期待的 ChatGPT Voice 语音交互功能。此次更新基于 OpenAI 本月早些时候推出的全新 ChatGPT-Live 语音模型系列,核心突破在于赋予了 AI 强大的本地任务执行能力,使其从单纯的对话助手进化为可操控电脑的智能体。
新增的语音功能支持 ChatGPT Work 和 Codex 两种模式,并能直接调用计算机操作系统层面的能力,访问各类网站和应用程序。在 macOS 平台上,通过名为 Appshots 的技术,ChatGPT 获得了屏幕感知能力,可以读取并理解屏幕显示的内容及图片的替代文本。这意味着用户可以通过语音下达包含多个步骤的复杂指令,例如要求 AI 创建新的代码线程、提交 Pull Request 或排查 Bug 根因。在执行过程中,若 AI 需要确认信息,用户可随时通过语音打断并回应,实现了真正的交互式自动化。
值得关注的是,OpenAI 并非唯一的探索者。竞争对手 Anthropic 同步更新了 Claude 的语音模式,该功能支持 Opus、Sonnet 和 Haiku 模型,并能在 Gmail、Slack、Notion 和 Canva 等主流生产力工具中直接执行操作。这标志着 AI 行业正加速从“生成内容”向“代理操作”转型,语音正逐渐成为控制数字世界的通用指令接口。
对开发工作流而言,这种“零手触”的交互方式是革命性的。它不仅降低了编写代码和调试的门槛,更意味着未来的软件开发将更多地转向“语音指挥 AI”的模式。Anthropic Claude 在同期的类似更新也印证了这一趋势:AI 厂商正竞相填补生成内容与实际操作系统任务之间的鸿沟。未来,能够安全、精准地调用系统工具链将成为衡量 AI Agent 实用性的关键指标。
💡 核心观点:语音交互正从“对话”进化为“指令”,标志着 AI Agent 从内容生成迈向系统级操作的新纪元。
原文链接:Linux.do
IT之家 8 月 9 日消息,发表在《判断与决策》期刊上的一项最新研究揭示了人工智能在创意写作领域的惊人表现。研究人员邀请了 1,682 名成年人参与实验,阅读 6 篇主题相似的短篇小说,其中 3 篇由人类作家创作,另 3 篇由 ChatGPT 生成。参与者被告知了作品的作者身份(但信息不一定准确),并被要求评价故事的吸引力与质量。结果显示,阅读 AI 生成故事的参与者普遍认为这些作品更具吸引力和高质量。然而,实验也暴露了明显的认知偏差:当参与者被告知故事由人类创作时,无论实际作者为何,他们给出的评分都会更高。为了测试辨别能力,研究人员进行了后续实验,要求 905 名参与者区分人类与 AI 作品。结果显示,参与者的平均正确率仅为 40% 至 52%,接近随机猜测水平,证明了大众无法有效区分两者。值得注意的是,对 AI 系统越熟悉的参与者,其判断准确率越高,这表明 AI 写作已形成特定风格,但这种风格目前仅对“内行”可见。尽管研究证明了 AI 在叙事能力上的进步,但学界人士也提出了警示,指出 AI 生成内容背后的环境成本及伦理问题依然是巨大的隐患。
💡 核心观点:AI 已具备不输人类的叙事能力,但人类创作的核心价值正从“内容质量”转向“人性真实性”。
原文链接:Linux.do
8月8日,一篇名为《在 Mac 上配合 Apple 智能使用千问》的技术支持文档现身苹果中国官网,首次在官方层面证实了 Apple 智能与阿里巴巴千问模型的深度合作。该文档详细披露了具体的接入方式和功能场景,指出用户需满足 macOS 26.6 或更高版本等系统要求,并需登录千问账户。功能方面,文档明确显示千问扩展可用于写作工具(如备忘录、邮件中的文本创作与改写)以及 Siri 助理(如回答问题、总结文稿)。然而,该文档在引发关注后迅速被苹果官方从网站删除,目前原链接无法访问。此次“误发”事件揭示了苹果在 Apple 智能落地中国市场时,选择了阿里作为核心模型合作伙伴之一,以替代全球范围内的 OpenAI 等服务,符合国内合规要求。
💡 核心观点:Apple 智能中国落地的“模型扩展”模式实锤,显示巨头在合规壁垒下必须倚仗本地大模型生态。
原文链接:Linux.do
本文介绍了一种名为“误差扩散抖动二维码”的技术,旨在解决二维码在嵌入图像时的视觉噪点问题。传统的艺术二维码通常将数据模块缩小以腾出空间显示图像,但简单的二值化处理会导致图像出现明显的“椒盐噪声”。虽然Floyd-Steinberg误差扩散算法比普通的Bayer滤镜能生成更平滑的渐变效果,但在二维码应用中,由于数据模块的颜色是强制固定的,这会引入巨大的误差,导致图像看起来依然粗糙。该技术方案的核心创新在于“双通道误差扩散”:第一遍专门处理二维码数据模块,将这些强制像素带来的巨大误差“扩散”到周围相邻的八个像素中;第二遍则进行常规的图像误差扩散。这种处理方式成功掩盖了数据模块的生硬边界,使得低分辨率的单色图像在保持可扫描性的同时,呈现出更高的视觉保真度。文章还探讨了实际应用中的权衡,指出这种高度定制化的二维码更适合屏幕显示或大型海报,而在折叠纸张等低质量印刷场景下,其抗干扰能力会有所下降,需要在美观度与鲁棒性之间寻找平衡。
💡 核心观点:利用经典误差扩散算法突破二维码视觉瓶颈,证明传统图形学技术在解决特定美学问题上仍有巨大潜力。
原文链接:Hacker News
这篇文章详细记录了一位开发者将闲置的 CMF Phone 1 手机(8核 ARM CPU、8GB 内存)转化为个人服务器的全过程。由于云服务器(VPS)成本上升及内存配置不足,作者试图挖掘闲置手机的计算潜力。在尝试刷入 postmarketOS 因驱动缺失失败后,作者确立了以原生 Android 为底层、Termux 为宿主环境的架构。通过 Root 权限利用 chroot 挂载 Debian 文件系统,作者解决了 PRoot 模拟带来的性能损耗问题,成功运行了包括桌面版 Chrome 在内的多种高负载应用。网络层采用 Tailscale 进行内网管理,利用 Cloudflare Tunnel 穿透 NAT 实现公网访问,并通过 Cloudflared 代理解决了旧设备的 TLS 验证问题。整个系统通过 Ansible 进行 GitOps 管理,实现了配置的版本化与自动化部署。这一实践不仅实现了零成本替代 VPS,还证明了现代高性能手机在配合电池备份的情况下,完全能够胜任稳定、低功耗的家庭边缘计算任务。
💡 核心观点:利用 Termux 与原生 Android 驱动相结合,将闲置高性能手机转化为边缘服务器,不仅是算力资源的极致复用,更展示了异构硬件在去中心化基础设施中的潜力。
原文链接:Hacker News
随着软件开发逐渐从手工编写向 AI 辅助转变,传统的集成开发环境(IDE)已难以完全满足以 Agent 为中心的编程需求。针对这一趋势,一款名为 Termio 的原生 Mac 终端 Agent 开发环境(ADE)正式发布。该项目基于 libghostty 内核构建,旨在提供高性能的终端用户界面(TUI)渲染能力,特别优化了对 AI Agent 交互的流畅度支持。与传统终端模拟器(如 iTerm2)或 IDE 不同,Termio 的产品设计逻辑完全围绕 AI 编程流程重构。它允许用户在一个界面内同时管理十几个 AI Agent 会话(如 Claude Code、Codex 等),并直观地展示项目状态与 Session 上下文。其核心功能集成了侧边文件树、代码 Diff 视图以及便捷的 Context 输入机制,使得开发者能够更高效地向 AI 提供背景信息并审查代码变更。此外,Termio 推出了配套的 iOS 客户端(目前处于 TestFlight 公测阶段),实现了跨平台的移动编程体验。这一设计支持“意图描述-异步执行-验收复核”的新型工作流,例如用户在移动端向 Agent 下达指令,Agent 在后台自动执行任务,用户回到桌面端即可进行验收。项目代码已在 GitHub 开源,致力于解决传统 IDE 布局在多 Agent 协作场景下的局限性。
💡 核心观点:从 IDE 到 ADE 的演进标志着开发工具从“辅助人类编写”转向“管理机器执行”,而终端与移动端的结合正是适应这一异步协作范式的关键尝试。
原文链接:V2EX 分享发现