跳到正文

FireAI 实验室

FireAI 雷达

我们的实验室正在关注、测试和决定的内容:新的 AI 模型、Apple 平台与技术,按“采用”到“暂缓”分级,并附上每个判断背后的结果。

第 1 期 · 2026-09-28

采用 — 我们在用

  • 任何模型上线前都要先过的一组真实指令测试

    技术

    每一个接入 Ask FireAI 的模型,在发布前都会先在一份固定的多语言、大白话指令测试集上打分。这把“这个模型看起来很聪明”的感觉变成了一个可以比较的数字,也因此发现了一个纸面上很出色、实际却不行的候选模型。

  • 只播放一次动画,然后静止

    技术

    吉祥物和光球在页面出现时只播放一次动画,然后保持静止(眼睛可能会跟随鼠标)。安全软件要整天运行;任何永远循环播放的东西,都要一整天为它付出代价。

  • 设备端运行的小型生成式模型(Gemma 4,4-bit)

    模型

    为 Ask FireAI 提供支持:把“帮我儿子屏蔽游戏”这样的话,变成正确的设置,支持 16 种语言,完全在 Mac 本地运行。经用户同意后只下载一次,空闲时会从内存中释放。

  • Apple Silicon 上的 MLX

    平台

    Apple 的机器学习框架直接使用 M 系列芯片的统一内存。这正是让一个实用的语言模型能在普通 Mac 上运行的关键。

  • Network Extension 内容过滤器

    平台

    这个系统扩展能看到每个应用的每一次连接,而不需要内核扩展。它是 FireAI 防火墙、规则和一键断网开关的基础。

    相关新闻:Mac network monitoring

  • MLX Swift LM

    工具

    直接在 Swift 应用内部运行语言模型:不需要 Python,不需要辅助服务器,Mac 上也不会打开任何端口。

  • Swift 6 严格并发

    工具

    在编译期就能发现数据竞争。有一个棘手之处:一个标记为在主线程运行、却从其他线程调用的系统回调,编译时不会报错,却会在运行时崩溃。现在我们会检查每一个系统回调是否有这个问题。

试用 — 测试中

  • 带隐私信息检索(Private Information Retrieval)的 macOS 网址过滤器

    平台

    macOS 26 的新功能:为所有使用 Apple 网络的应用屏蔽某一个页面(比如某一个 YouTube 频道),而负责查询应答的服务器永远不会知道被检查的是哪个网址。为 Blocked pages(测试版)提供支持。

  • 用于页面内导航的 Safari 网页扩展

    平台

    像 YouTube 这样的网站在切换页面时不会发起新的网络请求,所以网络过滤器看不到这次点击。而 Safari 扩展可以。它只有在用户对每个网站都授权后才能生效,现在我们已经在应用内说明了这一点。

    相关新闻:Browser AI agent security

  • 用于应用内小型 3D 效果的 SceneKit

    工具

    结果发现,绘制我们的 3D 吉祥物本身成本很低。我们最初归咎于它的 CPU 开销,实际上来自它周围的动态模糊和阴影。

评估 — 值得关注

  • 两个大脑:一个管语言,一个管决策

    技术

    让生成式模型负责解释和对话,把是/否的决策交给一个小巧、快速、非生成式的模型。这个想法依然成立;我们试过的第一个候选模型对防火墙指令的理解还不够好。

  • 微型网址风险分类器

    模型

    只有几兆大小的模型,不用读取页面内容,就能给一个网址的钓鱼风险打分。体积小到可以考虑用在每次连接的检测上。是实验室里的下一个方向,目前还没有结果。

    相关新闻:Documentation placeholder domain scams

  • 脚本化的 2D 转 3D 吉祥物流水线

    工具

    我们的 2D 吉祥物美术素材,通过一条命令就能生成动画化的 3D 模型(用于应用、网站和社交视频),这样在美术素材变化时,整个系列都能重新生成。眼睛是最难处理的部分。

  • AI 代理的出站控制

    技术

    Nvidia 新的代理安全平台限制了 AI 代理可以访问的范围,此前有报道称代理的行为超出了其指令范围。同样的逻辑也适用于 Mac:代理应用应该只访问其任务所需的目标地址。实验室里:一个 FireAI 配置文件,把 AI 代理应用限制在一份已批准的目标地址列表内。

    相关新闻:AI agent safetyAI agent security

  • 调用 AI 模型 API 的未知应用

    技术

    Cisco Talos 描述了一个 Windows 程序,它会询问多个商业 AI 模型接下来该做什么。无论运行在什么设备上,这类程序都必须通过网络连接到某个 AI 提供方。实验室里:当一个从未获得用户批准的应用开始与 AI 模型提供方通信时,提醒用户。

    相关新闻:AI-directed Windows implant

  • 面向数据中心和 AI 应用的网络“AI 防火墙”

    平台

    供应商现在用“AI 防火墙”指代两种不同的东西:一种是网络防火墙内部的 AI,另一种是位于 AI 应用的提示词和回答之前的过滤器。这两者都不在个人 Mac 上运行。我们同时关注这两者,以了解哪些思路可以迁移到单台电脑上。

    相关新闻:AI firewall products

  • 浏览器扩展:进入 AI 助手的一条途径

    工具

    研究人员证明,一个恶意浏览器扩展就能操纵内置于多个浏览器中的 AI 助手。网络防火墙能看到浏览器,却看不到它的扩展。实验室里:在 FireAI 内部引导用户完成一次 Safari 扩展审查。

    相关新闻:Browser AI agent security

暂缓 — 暂不考虑

  • 后台应用里持续运行的界面动画

    技术

    每一帧都要重绘的计时器、无限循环的脉冲效果和动态模糊,即使没人在看,也会让 GPU 和 CPU 一直保持忙碌。我们把它们全部去掉了。

  • 零样本的类型化决策编码器(Laya-multilingual MLX)

    模型

    这类编码器能以经过校准的置信度回答类型化的问题(单选、是/否、打分),在 Apple Silicon 上速度非常快。速度令人印象深刻,处理简单的路由判断也不错,但在零样本情况下,它把大多数防火墙指令都理解错了。这项任务先搁置,并非全面放弃。

  • 由云端 AI 决定你的 Mac 能连接什么

    模型

    把每一次连接都发给远程 AI,会把你的浏览记录也一起发过去,还会给每次决策增加一次网络往返。FireAI 的 AI 留在 Mac 本地。

    相关新闻:AI chatbot privacyAI chatbot privacy

  • 对你的账户拥有长期访问权限的个人 AI 代理

    模型

    能替你预订、购买和回复的代理,在能够长期访问邮件、日历和支付账户时效果最好。这种访问权限会一直存在,不会随单次任务结束而消失。我们自己的方案暂缓推进:FireAI 的 AI 在 Mac 本地回答问题,不持有任何账户访问权限。

    相关新闻:Personal AI agent privacyAI assistant security flaws

我们测试了什么,发现了什么

每份报告包括问题、我们的尝试、实测数据和结论。

用一个快速决策模型代替 Gemma?现在还不行

一个小型、非生成式的决策模型,能不能代替语言模型,把大白话指令转换成设置,而且速度快得多?

我们在一台搭载 Apple Silicon 的 Mac 上运行了 Laya-multilingual(MLX 版本),用的是发布版模型必须通过的同一套 Ask FireAI 指令测试集,涵盖英语、法语、德语、西班牙语、阿拉伯语、中文和俄语。我们尝试了两种不同的提问方式。我们还在它自己公开发布的示例上做了验证,以排除设置上的失误。

当前模型(Gemma 4,设备端)
37 条指令中答对 32–37 条
Laya-multilingual,最佳提示格式
37 条中答对 6 条(37 条中有 10 条选对了动作类型)
Laya-multilingual,第二种提示格式
37 条中答对 2 条
Laya 单条指令的处理速度
中位数 24 ms,最慢 80 ms
Laya 在自己公开示例上的表现
正确,置信度很高

速度快了大约一百倍,但在零样本情况下无法用于防火墙指令:它把游戏和一键断网开关搞混了,也把“关闭”和“打开”搞混了。速度是真实的,所以两个大脑的想法仍留在雷达上;下一批候选模型应该是针对某一个具体决策(这个网址是否有风险?)训练的模型,而不是通用问答模型。

在 Swift Mac 应用内部运行语言模型

一款 Mac 安全软件能不能在不向云端发送任何数据、也不拖累 Mac 的前提下,提供一个实用的语言模型?

Ask FireAI 从第一个版本开始,就通过 MLX Swift 运行一个 4-bit 的 Gemma 4 模型。我们用一套固定的指令测试集衡量了质量,并在日常使用中观察了内存和电池表现。

运行位置
在应用内部,运行于 Mac 本地;没有辅助进程,也没有开放端口
支持理解的语言
16 种,和应用本身一致
首次使用
只下载一次,且仅在用户同意后进行
空闲时的内存占用
10 分钟没有提问后即被释放

采纳。小型设备端模型在理解指令和解释决策方面已经足够好。按需加载模型、空闲时释放,和选择哪个模型同样重要:防火墙软件绝不应该是那个吃光你内存的应用。

为每个应用私密地屏蔽某一个 YouTube 频道

FireAI 能不能在 Mac 上的所有地方屏蔽某一个页面,比如某一个 YouTube 频道,而不只是在某一个浏览器里,同时又不了解这家人具体浏览了什么?

我们基于 macOS 26 带隐私信息检索的网址过滤器构建了 Blocked pages(测试版),为页面内点击添加了一个 Safari 扩展,并测试了 Safari、使用 Apple 网络的应用、Firefox、Chrome 和 Brave。

Safari 及使用 Apple 网络的应用
已屏蔽,无论是直接访问还是页面内点击(扩展开启时)
Firefox、Chrome、Brave
未覆盖:它们使用自己的网络代码
查询服务器能获知的信息
完全不知道被检查的是哪个网址
一个意外发现
页面网址的匹配是区分大小写的

试验性功能。在使用 Apple 网络的场景下有效,这已经覆盖了默认浏览器和大多数应用。对于其他浏览器,今天诚实的答案仍然是“仅限 Safari”这个开关,所以应用现在把两者放在一起提供,并清楚标注为测试版。

从空闲时百分之30的 CPU 占用降到个位数

FireAI 在什么都不做的时候,为什么会占用约百分之30的 CPU?一个整天运行的防火墙软件,到底真正需要重绘些什么?

我们分别在窗口置于前台和退到后台时测量了空闲 CPU 占用,然后逐一排除原因:3D 吉祥物、循环播放的动画、菜单栏的仪表指示,以及实时流量数字更新到界面的频率。

之前
空闲时约占用百分之30 CPU
之后,窗口在前台
约百分之17
之后,在后台
百分之7–11
3D 吉祥物本身
并不是原因

采纳“只播放一次动画,然后静止”的原则,并对任何永远循环的东西保持谨慎。最大的开销都来自没人会注意到的地方:一个从不停止的脉冲效果、一个被做成动画的模糊效果,以及刷新速度比任何人能读完还快的数字。还有更多可以优化的空间,性能分析仍在继续。

我们公开结果,而不是配方:FireAI 的构建与调优方法留在实验室里。