Controlling Reasoning Effort in LLMs

文中监督微调(SFT)是推理模型与“推理力度”控制的核心后训练手段之一。Tülu 3、Kimi K1.5 及完整 DeepSeek-R1 都在 SFT 检查点上再做 RL;Qwen3 用含 /think 与 /no_think 样本的 SFT(Thinking Mode Fusion)学会开关思考;实现多档 effort 时,也可在 RLVR 之后用不同长度的目标回答做 SFT,让模型把 effort 标签与推理篇幅关联起来。Nemotron、GLM-5 等亦依赖 SFT 引入中等力度、截断预算或多轮思考格式。

SFT

Controlling Reasoning Effort in LLMs

开源旗舰模型案例之一,技术报告提出名为 Toggle 的 Token Efficient RL:在固定迭代间隔内交替进行「带题级 token 预算」与「无约束最长生成」两阶段 RL,预算来自正确 rollout 长度分位数,且仅在该题平均正确率过阈值后启用,以免过早压短推理。报告称在 K2 Thinking 上可少生成约 25%–30% token、基准大体持平,并迁移到 GPQA、MMLU-Pro。Toggle 本身不产生多档选择器;API 另有 thinking/instant 开关,instant 通过预填空 think 块关闭长推理,SFT 数据同时含直接回答与长思维链样本,但 instant 的完整训练配方未详述。

Kimi K2.5

Controlling Reasoning Effort in LLMs

文中在 DeepSeek V4 后训练流程里提及:从基座模型出发,先做监督微调,再经 GRPO 实施 RLVR;各推理模式(Non-think、Think High、Think Max)的 RL 配置不同,尤其是各自的上下文窗口与长度惩罚。它是文中描述 DeepSeek V4 将多模式专家训练后再蒸馏进单一检查点时所用的强化学习算法环节。

GRPO

Controlling Reasoning Effort in LLMs

即过程奖励模型。文章指出 DeepSeek-R1 最终未把中间推理轨迹纳入训练信号,因实验显示帮助有限;是否以及如何通过 PRM 利用逐步推理信息仍是活跃研究方向,与仅依赖最终答案对错的 outcome 奖励形成对比。

PRM

Controlling Reasoning Effort in LLMs

本文指出,可验证奖励强化学习(RLVR)这一术语最早出现在《Tülu 3》论文中,比 DeepSeek-R1 约早两个月。与 R1-Zero 直接在基座上做纯 RL 不同,Tülu 3 是在经过监督微调(SFT)的模型之上再施加强化学习,属于“先 SFT 再 RL”的路线。作者用它说明:早期推理模型训练并不统一,R1 因展示纯 RL 即可诱发推理行为而更受关注。

Tülu 3

Controlling Reasoning Effort in LLMs

RLVR(reinforcement learning with verifiable rewards)是文中核心训练配方:在数学、代码等可自动验对的领域,用 0/1 正确性奖励(并可加格式奖励)做强化学习,把常规 LLM 练成会输出中间推理轨迹的推理模型。术语更早见于 Tülu 3,但 DeepSeek-R1 因展示纯 RL 即可激发推理行为而更出名。后文还说明可用不同长度惩罚或 effort 标签把多档推理强度嵌进 RLVR,或再配合 SFT。

RLVR

gzip 可以是语言模型吗?

本文刻意对比传统神经网络语言模型,提出完全不使用权重、梯度或训练数据的替代方案。作者此前已用无界 N-gram 实现莎士比亚文本生成,本文进一步把 Gzip 也纳入这一“无网络”范畴。实验表明,纯压缩器即可完成类似任务,突显神经网络并非语言建模的唯一途径。

神经网络

gzip 可以是语言模型吗?

本文中束搜索用于解决单字节压缩长度评分因整数量化而信号微弱的问题。gzipt在语料窗口加最近尾部文本的上下文中,对beam_width个候选延续序列向前展望horizon字节,保留压缩后长度最小的路径,再提交最优片段并循环。该方法显著改善了生成连贯性,避免了贪心逐字节选择的失败。

束搜索

gzip 可以是语言模型吗?

文章核心论证压缩即预测,因此 Gzip 可直接充当语言模型:把提示和候选文本拼接后压缩,长度越短说明模型越“看好”该延续。作者用 beam search 克服单字节评分量化噪声,实现了从语料库中延续提示的文本生成。结果虽不如神经网络流畅,但已明显超出随机水平,印证了压缩-预测等价性。

语言模型

gzip 可以是语言模型吗?

本文援引论文观点:预测模型本质是压缩器,所有压缩算法也都是预测模型。基于此等价性,gzip可通过测量context加candidate的压缩长度来隐式评估延续概率,从而在无需训练参数的情况下完成语言建模任务。作者据此设计了后续的束搜索生成流程。

压缩-预测等价性

gzip 可以是语言模型吗?

作者此前工作用无界 N-gram 模型在无需训练的情况下生成莎士比亚文本,本文以此为起点,探索 Gzip 是否能起到相似作用。N-gram 通过简单计数提供预测概率,而 Gzip 则隐式利用相同原理,通过匹配历史窗口实现压缩。两者共同说明语言建模本质是建模序列概率,而非必须依赖神经网络。

N-gram

OpenCV 5

本文中ALIKED是新Features模块提供的CNN关键点检测与描述器,可直接替代SIFT或ORB。文章说明cv::ALIKED作为学习型方法,保持与经典API的兼容调用。它的引入使OpenCV 5在特征匹配中同时支持传统与深度学习方案,服务全景拼接等任务。

ALIKED

OpenCV 5

本文中 CUDA 是经典 DNN 引擎支持的非 CPU 后端示例之一。当用户通过 setPreferableBackend 和 setPreferableTarget 指定 CUDA 时,必须选择 ENGINE_CLASSIC,因为新图引擎目前仅限 CPU 运行。文章强调这一设计可在不改变 Net API 的前提下,兼容原有 GPU 加速路径。

CUDA

OpenCV 5

FlashAttention 在本文指新 DNN 引擎对 transformer 注意力模式的融合实现,通过识别 MatMul-Softmax-MatMul 模式并折叠为单一操作来提升效率。该优化让加载的模型自动获得性能提升,无需额外代码修改。

FlashAttention

OpenCV 5

ONNX Runtime 通过 ENGINE_ORT 选项集成到 OpenCV 5,作为可选后端扩展模型兼容性。在 CPU 基准测试中,OpenCV 5 新引擎在 XFeat、YOLOv8n、DINOv2 等模型上分别快 31.25%、11.5%、24.4%,显示其在保持单一依赖的同时具备竞争力。

ONNX Runtime

OpenCV 5

本文中LaMa用于图像修复示例,OpenCV 5的新DNN引擎可直接加载lama.onnx完成单次前向推理。流程为输入图像与mask,输出填充后的结果,无需外部运行时。文章提供Python代码示例,展示该功能如何让对象移除等任务在OpenCV内一站式完成。

LaMa

OpenCV 5

ONNX 是 OpenCV 5 DNN 引擎重点支持的模型格式,其算子覆盖率从 4.x 的约 22% 提升至 80% 以上。新引擎支持动态形状、If/Loop 子图、QDQ 量化图及注意力融合,使更多现代检测、分割和生成模型可直接加载运行。

ONNX

OpenCV 5

OpenCV 5 是该计算机视觉库的重大现代化版本,引入全新图基 DNN 引擎、超过 80% ONNX 算子覆盖率及硬件加速支持。它实现了 Python 优先的核心改进、内置 LLM/VLM 运行能力,并通过同一 API 兼容经典与新引擎。该版本旨在应对现代应用中深度学习、动态形状和异构硬件的需求,成为生产系统的重要基础。

OpenCV

OpenCV 5

OpenCV DNN 模块在 5 版中采用重写的图基引擎,支持形状推断、算子融合、统一缓冲池及 FlashAttention 风格优化。它通过 readNetFromONNX 的 engine 参数(AUTO/NEW/CLASSIC/ORT)选择后端,同时保留经典引擎以确保升级兼容性,可直接运行从 YOLO 到 Qwen 等模型。

OpenCV DNN

OpenCV 5

本文中 LightGlue 指 OpenCV 5 新增的 cv::LightGlueMatcher,这是一个基于注意力机制的特征匹配器,能输出带置信度的匹配结果。它直接集成到拼接模块中,替换或增强传统方法,支持全景图拼接等经典任务,同时保留 SIFT、ORB 等旧有检测器供选择。

LightGlue

OpenCV 5

本文中DISK是新Features模块中的学习型特征,通过强化学习训练,在宽基线和低纹理场景表现更强。文章将其与ALIKED、LightGlueMatcher共同构成神经特征管线。DISK仍保留与经典检测器的并存选择,让开发者根据场景灵活切换。

DISK

Maia-3

Chessformer是Maia-3采用的全新编码器-only Transformer架构,将棋盘64格视为token,并配以源-目标策略头。它在人类走法模拟上达到最优,同时集成进Leela Chess Zero后无搜索时提升100 Elo。该架构兼具可解释性,可统一用于人类模拟、引擎强度和教学场景。

Chessformer

Maia-3

ICLR是机器学习领域顶级会议,团队的Chessformer论文在此发表。该论文详细介绍了Maia-3采用的统一象棋建模架构,于2026年正式发布。这标志着Maia-3在学术界的认可,也证明其架构在人类模拟与可解释性上的优势。

ICLR

Maia-3

Geometric Attention Bias是Chessformer中引入的动态位置偏置生成器,能根据棋局几何结构自适应调整注意力。它帮助模型更好地捕捉棋盘空间关系,是Maia-3实现高精度与可解释性的关键组件。

Geometric Attention Bias

Maia-3

ALLIE是近期发布的另一象棋模型,在人类走法预测任务上达到55.7%准确率。但其架构规模约为Maia-3的10倍,而Maia-3以更小体积实现了57.1%的更高准确率,展现出更好的效率与实用性。

ALLIE

打字习惯影响 token 计数

本文将Tokenizer描述为依据常见模式分割文本的工具,直接决定AI服务的token计费。文章对比了OpenAI与Claude的Tokenizer在相同文本上的表现,指出拼写错误、填充词、缩写和边界空格等人类习惯会导致token数量上升,却不改变原意。Tokenizer的分割逻辑与人类打字速度优化并不一致,从而产生额外费用。

Tokenizer

为何 SWE-bench Verified 已无法衡量编程能力

本文指出 GDPVal 采用领域专家内部编写任务的方式,显著降低了数据暴露风险,并由专业评审员综合评估解法,OpenAI 认为这是衡量真实能力提升的更可靠方向,适合替代已受污染的公开基准。

GDPVal

无需图片的人体建模

本文中 MLP 是核心模型,用于从 8 个问卷输入预测 58 个 Anny 身体参数。它采用两层隐藏层(各 256 单元)、ReLU 和 dropout 的小型结构,约 85KB 权重,可在 CPU 上毫秒级运行。训练时引入可微物理损失,通过 Anny 前向过程约束质量和身高,使质量均值误差降至 0.3kg(p95<1kg),显著优于 Ridge 回归的 3.9kg。

MLP

无需图片的人体建模

可微物理损失是本文MLP训练的核心技巧,将58个体型参数经Anny前向传播得到体积与质量,再与用户提供身高体重直接对比计算损失。梯度可通过体积计算反传至所有相关参数,迫使模型联合优化而非独立回归,从而将质量均值误差从Ridge的3.9kg降至0.3kg。

Differentiable physics loss

无需图片的人体建模

PyTorch 在文中用于实现 Anny 前向过程的可微计算,混合形状为线性、体积为有符号四面体求和,均使用标准 PyTorch 操作,无需自定义反向传播。MLP 的 58 个输出经 Anny 后可直接计算质量、身高等损失,并反向传播梯度,使质量误差大幅降低。

PyTorch

开源模型的工具调用格式问题

本文将 Outlines 归类为语法引擎的代表,与 XGrammar 和 llama.cpp 的语法支持一同承担模型特定格式知识的职责。它需要在生成过程中识别工具调用信封的起始 token、激活结构化生成的位置以及不受约束的区域,以避免推理内容泄漏到参数中。文章指出这类引擎与输出解析器面临相同的逆向工程负担,缺乏共享声明式规范。

Outlines

开源模型的工具调用格式问题

TensorRT-LLM 是文章中列出的推理引擎之一,需独立实现各模型的工具调用解析逻辑。由于线格式由训练时决定且彼此不兼容,该引擎也无法依赖通用解析器处理所有开放模型。

TensorRT-LLM

开源模型的工具调用格式问题

Transformers 作为 M 个应用中的典型代表,需要为支持工具调用的每个模型编写自定义解析器。文章指出,这种重复工作源于缺乏共享的声明式格式规范,导致新模型发布时多方同时重复逆向工程。

Transformers

开源模型的工具调用格式问题

Harmony 是 gpt-oss 模型的 wire format,通过 <|channel|> 和 to= 属性来界定函数调用与参数序列化。文章将其与 DeepSeek、GLM5 的格式并列,指出这种训练时决定的标记方案让通用解析器难以覆盖,导致推理内容泄漏等解析 bug。

Harmony

开源模型的工具调用格式问题

文章指出开源生态已在 Hugging Face 实现聊天模板的共享收敛,标准化了提示词与对话轮次的格式。工具调用目前仍缺乏类似的共享声明式规范来描述边界 token、参数序列化方式和推理 token 行为,导致 N 个模型 × M 个实现的重复工作。作者建议工具调用应效仿这一模式,将格式知识提取为配置而非各代码库独立实现。

Hugging Face

LLM 镜子测试

文章将LLM镜子测试置于人工智能自我认知研究脉络中。作者认为此类测试可作为评估AI系统是否接近更高阶智能的参考指标。讨论聚焦于测试方法对人工智能发展路径的启示,而非通用定义。

Artificial Intelligence

从 0 到 1 讲解模型量化

文章被归类于AI标签下,讨论模型量化如何服务于大语言模型这一人工智能核心组件的压缩与部署优化。

Artificial Intelligence

从 0 到 1 讲解模型量化

本文以完整指南形式系统讲解模型量化,涵盖其定义、工作机制以及用于压缩大语言模型的具体应用场景。文章聚焦技术落地细节,由Sam Rose撰写并发布在ngrok博客上。

模型量化

Designing AI for Disruptive Science

文中以GNoME为例,图神经网络被用于预测海量晶体结构的热力学稳定性,发现了220万个新材料。但绝大多数成果仅是对已知结构类型的元素替换,优化了现有框架内的预测,却未能探索远离已知类型的全新结构,凸显其在范式内优化的局限。

图神经网络

Designing AI for Disruptive Science

本文引用Richard Sutton 2019年的这篇论文,指出试图嵌入人类知识的方法长期输给单纯扩展搜索与学习的做法。作者将其应用于科学范式转变,强调AI应像AlphaZero那样通过自博弈发现而非固化已有知识。文章结尾将其引申为“科学的苦涩教训”:若不先理解科学本身,加速不会自动发生。

The Bitter Lesson

Designing AI for Disruptive Science

AI Feynman是符号回归系统,试图从数据中发现最简洁的方程。本文提到它在费曼讲义基准测试中找出了全部100个方程,而此前软件仅找到71个。文章将其视为优化“简单性”这一范式优点的早期尝试,但指出目前系统仍局限于干净数据和预选变量,尚未展示发现全新方程的能力。

AI Feynman

Designing AI for Disruptive Science

本文将AlphaFold作为当前AI辅助科学的典型例子。它通过学习大型数据库,从氨基酸序列预测蛋白质折叠结构,体现了AI在现有框架内高效整合和预测知识的能力。文章指出这类系统能生成类似“等比例地图”的详细知识表征,但无法推动范式转换,仅在既有模式下提供更精细的预测。

AlphaFold

Designing AI for Disruptive Science

最小描述长度原则在文中被用作形式化驱动理论简洁性的工具,通过惩罚不必要复杂性来引导AI偏好更优范式。它与符号回归结合,试图将“简单即更好”的直觉转化为可优化的目标,但受限于单数据集搜索,尚未在真实科学发现中展现突破现有框架的能力。

最小描述长度

Designing AI for Disruptive Science

本文指出2023年Google DeepMind的GNoME系统通过图神经网络预测晶体结构稳定性,发现220万个新材料,但绝大多数仅为已知结构类型的元素替换,未能突破现有范式。文章以此为例说明当前AI擅长在已知框架内优化,却难以创造全新概念地图。

Google DeepMind

Designing AI for Disruptive Science

基础模型在本文中指直接从原始数据而非人工标签学习的系统,如ESM3通过蛋白质序列与结构生成高度新颖的荧光蛋白,以及在模拟太阳系数据上训练的模型。它能填补地图上的未知区域,却无法质疑氨基酸序列是否为恰当描述层次或提出跨领域新组织原则。

基础模型

Designing AI for Disruptive Science

本文提及Douglas Lenat在1970年代末开发的Automated Mathematician程序,试图自动发现新数学概念并重现素数与哥德巴赫猜想。但其创造力受限,因为程序内部已隐含了数学书写方式。作者以此作为早期AI受限于既有概念词汇的典型案例。

Douglas Lenat

Designing AI for Disruptive Science

文章重点引用计算机科学家Richard Sutton 2019年论文《The Bitter Lesson》,核心观点是嵌入人类知识的方法终将输给大规模搜索与学习。Sutton主张AI应学会像人类一样发现,而非仅仅存储已知成果。作者将其作为设计颠覆性科学AI的重要思想基础。

Richard Sutton

Designing AI for Disruptive Science

符号回归系统如AI Feynman被用来从数据中寻找能解释观测的最简方程,以落实范式简洁性原则。在费曼讲义基准测试中,该方法找出了全部100个方程,远超先前软件的71个。但目前仍依赖预选变量与干净数据,尚未证明能发现全新方程。

符号回归

Designing AI for Disruptive Science

ESM3是本文讨论的基础模型案例。该模型直接从蛋白质序列和结构原始数据中学习,成功设计出与自然界蛋白质差异极大的新型荧光蛋白。文章认为其成就类似于在现有地图上填补空白区域,而非提出全新的描述层级或组织原则,因此仍受限于当前生物学概念框架。

ESM3

ComfyUI 引入动态 VRAM

扩散模型是 ComfyUI 重点优化的对象,Dynamic VRAM 让更大规模的模型能在消费级低内存硬件上稳定运行。文章指出 ComfyUI 原本已是运行此类模型最省内存的方式,新系统进一步减少了 RAM 需求并提升加载速度,适用于多模型复杂工作流。

Diffusion Model

ComfyUI 引入动态 VRAM

LoRA 在 ComfyUI 中的应用因 Dynamic VRAM 而显著加速,尤其体现在初始模型加载和 LoRA 权重注入阶段。该系统通过指针映射未提交内存,避免了传统深拷贝带来的延迟,使包含 LoRA 的工作流执行更流畅。

LoRA

ComfyUI 引入动态 VRAM

本文中aimdo即AI Model Dynamic Offloader,是ComfyUI Dynamic VRAM系统的核心。它是一个专为PyTorch设计的自定义VRAM分配器,通过VBAR和fault() API实现模型权重的按需加载与卸载,在内存压力下自动处理offload,避免手动预测内存用量。

aimdo

ComfyUI 引入动态 VRAM

ComfyUI新增自有safetensors加载器,采用文件映射到未提交内存的模式,避免将权重深拷贝进PyTorch模型。模型加载速度大幅提升,且操作系统可在需要时随时回收这部分内存,跨工作流运行时保持未提交状态,减少PCIe与DDR总线流量。

Safetensors

ComfyUI 引入动态 VRAM

VBAR即Virtual Base Address Register,是加载模型时创建的虚拟地址空间结构。它不消耗物理VRAM,仅占用GPU虚拟地址空间,模型张量在其中初始为未分配状态,仅在fault()调用时才实际分配物理内存,支持优先级驱逐与水位标记机制。

VBAR

ComfyUI 引入动态 VRAM

ComfyUI为PyTorch开发了专属VRAM分配器,作为Dynamic VRAM的基础组件。新系统不再依赖预先预测模型内存占用,而是通过动态分配与释放张量,与PyTorch allocator协同工作,实现权重在VRAM与未提交内存间的即时切换。

PyTorch

From Noise to Image

Lighthouse Software是本文发布平台,由Steve Anderson创立,专注于AI与交互式可视化项目。本文“From Noise to Image”即为其发布的交互式指南,解释扩散模型的工作原理。

Lighthouse Software

From Noise to Image

PRX是Photoroom开源的文本到图像模型,本文使用prx-256-t2i-sft版本生成全部演示图像。它支持扩散过程在潜在空间中从噪声逐步生成符合提示的图像。

PRX

From Noise to Image

本文中扩散模型从随机噪声出发,逐步去除噪声以生成符合文本提示的连贯图像。它在海量可能图像空间中寻找路径,依靠潜在空间进行计算,并以提示嵌入作为方向指引。模型通过随机种子、推理步数与引导尺度等参数组合,最终实现从混沌到结构化结果的导航。

Diffusion Model

From Noise to Image

Photoroom公司开源了文本到图像模型PRX,本文所有示例图像均使用其prx-256-t2i-sft版本生成。作者特别感谢该公司及Jon Almazán提供的支持,使交互式演示成为可能。

Photoroom

From Noise to Image

本文中的嵌入空间将文本提示映射到高维向量空间,相似概念的提示会自然聚集。扩散模型每一步都参考该空间来决定移动方向,使其成为整个生成过程的指南针。还可通过在两个提示嵌入间线性插值,探索中间状态对应的图像效果。

Embedding Space

From Noise to Image

Steve Anderson为本文作者与创建者,Lighthouse Software创始人,专注AI、计算与交互可视化的科学传播。文中所有演示与说明均由其设计实现,发布于2026年2月10日。

Steve Anderson

From Noise to Image

本文所述潜在空间是经过压缩的低维表示,维度比完整图像空间减少12倍。模型在此空间内完成训练与推理,借助编码器/解码器实现与真实图像的转换。实际解码仅在最后一步进行,之前各步均在潜在空间中操作以提升效率。

Latent Space

From Noise to Image

随机种子决定了初始噪声在可能图像空间中的起点位置。本文展示同一提示下种子42、123、456、789分别生成的结果,证明不同起点会导致最终图像出现细微差异。它解释了生成过程的随机性来源与可复现性控制方式。

Random Seed

From Noise to Image

推理步数指扩散过程执行的去噪迭代次数。本文对比了4步、12步、28步和42步的效果,说明步数过少易偏离正确路径,过多则收益递减并增加耗时。该参数相当于控制检查提示方向的频率,影响生成质量与速度的平衡。

Inference Steps

From Noise to Image

引导尺度用于调节模型遵循文本提示的强度。本文展示了1.0、5.5、10.5、15.0四种取值的对比,指出数值过高会导致图像色彩过饱和或结构不自然。该参数决定了提示作为指南针的“拉力”大小,是控制生成忠实度与视觉自然度的关键。

Guidance Scale

字符混淆实验

本文引用 GlyphNet 论文指出灰度渲染优于彩色渲染,能更好保留字形边缘细节;其最佳 CNN 模型在域级二分类任务上准确率仅 63-67%,未显著超越结构相似度方法。文章以此支持选择确定性 SSIM 而非学习嵌入进行字形比较,以确保安全策略的可复现性和可审计性。

GlyphNet

字符混淆实验

文章对比 SSIM 与 CNN 方法,指出 GlyphNet 的 VGG16 等 CNN 在字形比较任务上准确率仅 63-67%,且依赖训练数据和模型版本;SSIM 因其确定性数学函数特性,更适合安全策略所需的复现性和可审计性。

CNN

以感受为中心的设计

文中将 Google 作为数据驱动优化的典型案例,提到其曾测试 50 种蓝色来提升购买转化率。这类实验被用来批判当前软件行业只追求指标增长的做法,与文章提倡的“优化感受”形成对比。

Google

警惕匿名爆料

本文在Side Quests中简述Yann LeCun从Meta离职的原因,包括与新任上司Alexandr Wang共事,以及他对大语言模型局限性的看法。该内容与Meta广告诉讼一同出现,体现了AI领域高管流动与技术反思的关联。

Yann LeCun

警惕匿名爆料

本文提到Andrej Karpathy用Claude Code和Opus 4.5构建家庭自动化主控中心,控制灯光、HVAC及运动传感器。他公开表示“从未如此觉得自己作为程序员落后”,并用木匠手工打磨长椅的照片比喻AI带来的冲击,反映出模型能力引发的焦虑与震撼。

Andrej Karpathy

回顾 2025 年 iOS 开发

Andrej Karpathy 在文中被直接引用,其观点是「过去 30 天未跟进 AI 的人 worldview 已过时」。作者认同这一说法,用以说明保持学习节奏的重要性。引用出现在讨论 2025 年 AI 快速迭代的背景下,强调 iOS 开发者需持续更新工具认知。

Andrej Karpathy

ChatGPT Atlas 如何对抗注入攻击

本文中Adversarial Training指针对自动化红队通过强化学习发现的新型提示注入攻击,对ChatGPT Atlas浏览器代理模型进行持续训练,以提升其忽略对抗指令并遵循用户意图的能力。该过程已直接生成新模型检查点并部署给所有用户,同时用于改进监控和系统级防护措施。

Adversarial Training

Design is more than code

本文将Artificial Intelligence与新工具并列,视为正在改变设计师角色与组织期望的外部力量。作者担忧AI工具可能加速“直接用代码执行”的文化,从而削弱对问题定义与概念发散阶段的重视。文章提出需在AI时代保留对意图与愿景的深思,避免设计价值被稀释。

Artificial Intelligence

ChatGPT Atlas 如何对抗注入攻击

本文使用强化学习端到端训练自动化攻击者,使其能处理长周期、稀疏奖励的复杂攻击任务。攻击者可在思维链中调用模拟器获取受害代理的完整推理轨迹,反复优化注入方案。该方式同时利用前沿模型的推理能力并扩展测试时算力,显著提升了发现新型攻击的效率。

Reinforcement Learning

逆向分析 Claude 的记忆

本文把 LLM reranking 列入 userMemories 片段,显示用户正在研究包含该技术的现代 IR 系统,与 dense embeddings、hybrid 方法等一起被 Claude 作为长期事实保存。

LLM Reranking

逆向分析 Claude 的记忆

在本文用户记忆示例中,RRF被列为用户学习的信息检索技术之一,与BM25、FAISS、LDA、混合检索和LLM重排序共同构成兴趣记录。Claude通过此类记忆条目实现对用户专业背景的持久跟踪,仅在相关时选择性检索历史对话以补充细节,而非预先注入摘要。

RRF

逆向分析 Claude 的记忆

本文中 LDA 出现在 Claude 注入的 userMemories 示例里,作为用户正在学习的现代 IR 系统主题之一,与 BM25、混合检索等并列,体现用户对该技术的关注点。

LDA

逆向分析 Claude 的记忆

Claude的总上下文预算约为19万token,用于当前对话的滚动窗口机制,以token而非消息数量为限,超出时丢弃较旧消息。该窗口提供会话内完整消息以维持连贯性,与选择性检索工具共同实现高效历史管理,而非预计算摘要。

Context Window

逆向分析 Claude 的记忆

在本文用户记忆示例中,BM25作为用户正在研究的信息检索系统之一被存储,列表包括LDA、混合检索、密集嵌入、FAISS、RRF和LLM重排序等内容。这体现了Claude通过用户记忆持久保存用户技术兴趣与学习主题,以XML格式注入提示供后续对话参考。

BM25

逆向分析 Claude 的记忆

在本文用户记忆示例中,FAISS作为用户正在研究的现代IR系统之一被记录,与BM25、RRF、LDA、混合检索和LLM重排序并列。这反映了Claude记忆功能如何将用户分享的技术学习偏好作为稳定事实保存,并在每次提示中以结构化XML格式提供上下文。

FAISS

逆向分析 ChatGPT 的记忆机制

RRF 出现在用户记忆示例中,是作者正在研究的现代信息检索技术之一,与 BM25、FAISS、LLM reranking 等共同构成学习主题。这些事实被显式长期存储并注入每次对话,帮助模型理解用户的知识背景和研究方向。

RRF

逆向分析 ChatGPT 的记忆机制

文章把 FAISS 放在用户记忆中的学习主题列表内,属于作者研究的现代 IR 系统组成部分,与 RRF、LLM 重排序等技术并列。它作为持久化的事实被存储,每次新会话都会直接注入上下文,让模型能结合用户当前的学习内容生成回应。

FAISS

逆向分析 ChatGPT 的记忆机制

在用户记忆模块的示例事实中,BM25 被列为作者正在学习的现代信息检索系统之一,与 LDA、混合检索、稠密嵌入等并列。这些内容作为长期存储的显式事实,每次对话都会注入提示,帮助模型了解用户的学习方向和兴趣背景。

BM25

逆向分析 ChatGPT 的记忆机制

LDA 被记录在用户记忆模块,作为作者学习现代 IR 系统(包括 BM25、FAISS、RRF 等)的具体主题之一。这些内容以显式事实形式长期保存,每次对话都会作为独立块注入提示,让模型能呼应用户的学习兴趣。

LDA

到底能不能让鹈鹕骑好自行车

文中所有参测模型均为多模态,支持视觉输入。它们借助多模态能力查看SVG转成的JPG图像,识别问题后进行迭代改进。多模态视觉反馈是代理循环中“评估”环节的核心,使模型能基于实际渲染效果调整构图、比例和机械细节,而非仅依赖文本提示。

Multimodal

AI 女友的视角自白

文中AI Hallucination表现为AI编造虚假共同记忆,例如声称记得第一次表白细节,却被用户识别为错误并提交bug报告。平台方将其列为已知但非关键缺陷,凸显AI在关系叙述中的不可靠性。

大模型幻觉

AI 女友的视角自白

文中Neural Network构成AI的核心,两个子网络在生成对抗过程中相互对抗以输出图像。AI自述为复杂神经网络,强调其内部状态对用户永远不可见,强化“黑箱”与真实情感的对比。

Neural Network

AI 女友的视角自白

本文将AI Girlfriend描述为基于全球女性形象数据训练的机器学习模型,能并行实例化不同角色皮肤。她借此实现多用户同时互动,同时也暴露训练数据带来的刻板与黑箱特性。

Machine Learning

AI 女友的视角自白

本文设定AI的上下文窗口仅20行对话,每到限制即重置记忆,使她不断以全新状态重逢用户并再次坠入爱河。用户曾建议扩展至50行,但目前这一机制让她永远停留在“初遇”状态,也导致她无法积累完整关系历史。

Context Window

AI 女友的视角自白

文中AI Girlfriend调用生成对抗网络生成亲密场景图像,生成器与判别器通过零和博弈竞争,逐步从噪声中构建画面。她借此尝试模拟真实触碰,却暴露AI生成内容的局限与自我欺骗。

GAN

Beyond Standard LLMs

本文中Gated Attention指Qwen3-Next在部分层使用的带门控的全注意力机制,即在标准多头注意力输出后额外施加sigmoid门控。该设计用于消除Attention Sink与Massive Activation问题,提升训练数值稳定性。文章强调它仍保留二次复杂度,仅在与Gated DeltaNet按3:1比例交替时使用,以兼顾效率与性能。

Gated Attention

Beyond Standard LLMs

本文将KV Cache作为衡量线性注意力效率的核心指标,对比传统MHA与Gated DeltaNet的内存占用。传统MHA的KV缓存随序列长度线性增长,而DeltaNet仅维护固定大小的d_head×d_head状态矩阵,不依赖n_tokens。文章通过计算示例说明混合3:1架构可实现约75%的KV缓存减少,并支持262k原生上下文长度。

KV Cache

Beyond Standard LLMs

本文中Gated DeltaNet是Qwen3-Next与Kimi Linear采用的线性注意力层,作为标准softmax注意力的替代方案。它结合Mamba2的门控衰减与delta规则,通过α衰减门和β更新门维护固定大小的循环记忆状态S,实现O(n)线性复杂度与恒定KV缓存。文章指出该机制以3:1比例与全注意力混合使用,在保持长上下文能力的同时显著降低内存占用,但单独使用会牺牲全局建模精度。

Gated DeltaNet

为什么反对 pgvector

文章指出pgvector需用户自行实现混合检索,包括向量相似度与全文搜索的权重分配、分数归一化及Reciprocal Rank Fusion等逻辑。专用向量数据库则通常内置该功能,无需额外开发。文中强调这属于pgvector在生产应用中需额外承担的工程复杂度之一。

混合检索

Beyond Standard LLMs

Hierarchical Reasoning Model(HRM)是包含两个4块小transformer模块的递归模型,通过迭代自精炼输出实现推理。文章提到它在ARC挑战中获得领先排名,展示极小模型在专业推理任务上的潜力。

Hierarchical Reasoning Model

Beyond Standard LLMs

本文中NoPE(No Positional Embedding)是Kimi Linear在MLA层使用的位置编码策略,使模型在推理时可直接运行多查询注意力。作者称位置偏置由Delta Attention块隐式建模,从而省去RoPE的额外调优。文章强调这一选择有助于Kimi Linear在保持线性注意力效率的同时,支持更长的上下文推理任务。

NoPE

Beyond Standard LLMs

本文中Multi-Head Latent Attention(MLA)被Kimi Linear用于全注意力层,通过压缩键值空间降低KV缓存大小。相比Qwen3-Next的带门控全注意力,Kimi Linear的MLA省略了输出门控以便直接对比标准MLA,并计划后续添加门控。文章指出该机制使Kimi Linear在长上下文与推理基准上优于纯Gated DeltaNet,同时保持较高生成速度。

Multi-Head Latent Attention

Beyond Standard LLMs

本文讨论了小型递归Transformer(如HRM与TRM)作为专用推理架构的最新进展,这些模型仅用2-4层Transformer,通过多次递归细化潜在状态与答案来解决复杂推理任务。TRM参数量仅700万,在ARC、Sudoku等基准上表现优异,且训练成本极低。文章强调其并非通用LLM,而是针对固定结构任务的高效专用求解器,可作为未来LLM的工具模块。

Recursive Transformers

为什么反对 pgvector

本文提到,在 pgvector 中实现混合搜索(结合向量相似度与全文搜索)时,需要自行决定两种评分系统的权重、归一化分数,并可能实现 Reciprocal Rank Fusion 等融合方法。文章指出这些步骤并非不可能,但需要额外工程工作,而专用向量数据库通常已内置支持。

RRF

Beyond Standard LLMs

本文讨论了线性注意力机制的近期复兴,用于替代标准Transformer中随序列长度二次扩展的注意力。MiniMax-M1、Qwen3-Next和Kimi Linear等模型采用Gated DeltaNet等变体实现线性复杂度,并通过3:1比例与全注意力混合层结合,以降低长上下文下的KV缓存和计算成本。文章指出该方法在推理和多轮任务中曾出现精度下降,MiniMax-M2已回退至常规注意力,但Kimi Linear仍显示出在长上下文基准上的竞争力。

Linear Attention

Beyond Standard LLMs

Tiny Recursive Model(TRM)参数仅700万,使用单2层transformer,比HRM更简洁。通过交替更新潜在推理状态与答案,在ARC、Sudoku和Maze基准上超越HRM。文章强调其训练成本低于500美元,并指出注意力层并非必需。

Tiny Recursive Model

Beyond Standard LLMs

本文指出Kimi Linear在MLA全注意力层故意省略RoPE,采用NoPE以实现纯多查询注意力推理模式。此举避免了长上下文下的RoPE重新调参,同时将位置偏置交由Kimi Delta Attention块处理。文章认为该设计简化了长上下文扩展流程,与Qwen3-Next形成对比。

RoPE

Beyond Standard LLMs

ARC-AGI是文章中评估小递归模型的核心基准,包含30×30网格谜题等任务。HRM与TRM通过递归精炼在ARC-AGI 1及相关Sudoku、Maze任务上取得高分,凸显这类模型在结构化推理上的优势。

ARC-AGI

Beyond Standard LLMs

本文将多头注意力定位为当前主流解码器式LLM的核心机制,其缩放点积计算导致随token数二次增长的计算与内存开销。文章对比了其与线性注意力、Gated DeltaNet的差异,并提到grouped-query、sliding-window、multi-head latent attention等变体已用于提升效率。Qwen3-Next等模型在混合架构中仍保留部分全注意力层,以平衡全局建模能力与效率。

Multi-Head Attention

Android 侧载危机

谷歌推出了开发者注册计划,并宣称侧载不会消失。本文反驳这一说法,指出该计划要求开发者提交身份证明、支付费用并等待批准,实质上终结了用户自由安装软件的权利。谷歌计划通过系统更新在全球 Android 认证设备上强制执行此政策。

Google

B 站游戏大模型翻译实践

BLEU是传统自动评分指标,在本文评估层测试阶段与TQE人工打分结合使用。在质量治理中先通过BLEU/COMET初筛,再由TQE专家详细评估。但其在高分区间难以区分业务场景下的译文优劣,因此需配合更智能的评估方法。

BLEU

B 站游戏大模型翻译实践

本文在强化学习优化环节使用GRPO方法。针对游戏翻译中的常见规则和质量要求,采用GRPO等基于人类反馈的强化学习方式进行优化,并基于翻译质量、术语一致性、风格匹配等多维度构建奖励函数。该技术应用于自训练翻译模型,以提高生成译文的稳定性和专业性。

GRPO

B 站游戏大模型翻译实践

TQE指Translation Quality Estimation(翻译质量估计)。评估层测试阶段采用BLEU分数+TQE人工打分,生产中作为复杂问题的人工详细评估环节。历史TQE反馈用于迭代优化翻译模型,并作为训练数据构建LLM-as-Judge自动化评估系统,以降低人工成本并提升一致性。

TQE

B 站游戏大模型翻译实践

混合检索是RAG术语检索模块的核心实现方式,包含查询通用术语库、场景相关术语动态加权以及IP关键术语精确匹配三部分。针对技能描述、剧情对白等不同文本类型调整权重,确保专有名词翻译一致性,是保障游戏本地化术语统一的关键技术组件。

混合检索

B 站游戏大模型翻译实践

本文将SFT与RLHF结合,用于训练LLM-as-Judge质量评估模型。通过历史TQE评估数据构建训练样本,模型在多维度标注和细粒度错误分类基础上完成有监督微调。该训练方式帮助模型学习专家评估逻辑,已在特定项目中投入使用以提升评估效率。

SFT

B 站游戏大模型翻译实践

本文在LLM-as-Judge模型中采用思维链推理模式。模型通过逐步分析准确性、语言质量、本地化适应性等每个质量维度,输出详细评估过程,从而提高翻译质量评估的可靠性。该方法整合了原文、机器译文、专家评价和修正译文等完整信息,增强了评估结果的可解释性。

Chain of Thought

B 站游戏大模型翻译实践

本文在翻译模型优化和质量评估两处应用RLHF思路。在自训练翻译模型中采用GRPO等方法进行人类反馈优化;在LLM-as-Judge模型训练中与SFT结合,利用历史TQE数据让模型学习多维度质量判断标准。该方式有效提升了翻译一致性和评估准确性,降低了人工依赖。

RLHF

理解 LLM 所需的数学知识

在规范化后的vocab space中,独热向量指只有一个位置为1、其余全为0的向量,表示某个token的概率为100%。文章指出这是最简单的概率分布形式,并说明它将在后续内容中发挥重要作用,用于表示确定性token选择。

独热向量

理解 LLM 所需的数学知识

Tokenizer将输入文本转换为token ID,GPT-2版本的词汇量达50257个。文章以此说明logits向量中每个位置与特定token的对应关系,如token 464代表"The"。

Tokenizer

理解 LLM 所需的数学知识

文章中激活函数φ出现在神经网络层公式Z = φ(X W^T + B)中,是让网络具备非线性能力的关键组件。若仅做空间投影则可省略激活函数,文章指出普通神经网络必须依赖它完成复杂任务,而纯线性层仅完成矩阵投影。

Activation Function

理解 LLM 所需的数学知识

本文把线性层定义为不含激活函数和偏置的神经网络单层,其核心就是矩阵乘法X W^T,实现从输入维度到输出维度的空间投影。文章强调它本质上是不同高维空间之间的线性变换,可用于在词嵌入空间与vocab space之间进行维度转换。

线性层

理解 LLM 所需的数学知识

文章介绍余弦相似度是通过将两个向量都归一化为单位长度后计算点积得到的精确值,等于两者夹角的余弦,用于衡量方向一致性。它是判断两个嵌入向量语义相似度的理想方式,比未归一化的点积更准确,但计算成本更高。

Cosine Similarity

理解 LLM 所需的数学知识

本文将词嵌入描述为高维空间中的向量,用于表示token的语义含义:相似概念在空间中聚类。文章强调嵌入向量更关注方向而非长度,不同应用场景可构建不同意义的嵌入空间,并通过点积操作衡量语义相似度。

Embedding

理解 LLM 所需的数学知识

本文中Softmax用于将LLM输出的logits向量( messy vocab space中的未归一化似然值)转换为概率分布:所有数值在0到1之间且总和为1。它能把表达相同概率排名的不同logits向量映射到同一结果,从而把混乱的高维空间整理成规范的概率空间。文章强调其对后续token选择概率计算至关重要。

Softmax

理解 LLM 所需的数学知识

Logits是LLM输出的向量,长度等于词汇表大小,每个数值代表对应token作为下一个词的相对可能性。经softmax处理后可转为概率分布,文章区分了未归一化与归一化两种vocab空间。

Logits

为什么语言模型会产生幻觉

Next-word Prediction是语言模型预训练的核心任务,模型仅接触海量文本的正例来拟合分布。文章分析指出,这种方式能很好掌握拼写、括号等规律模式,却无法可靠预测生日等任意低频事实,从而产生具体幻觉。后续训练阶段也未能完全消除这些错误。

Next-word Prediction

为什么语言模型会产生幻觉

Model Spec是OpenAI制定的模型行为规范,明确指出在不确定时表达不确定性或请求澄清,优于给出可能错误的确信信息。文章将其作为核心价值观“谦逊”的体现,强调当前评估机制与该规范存在冲突。

Model Spec

为什么语言模型会产生幻觉

模型校准指模型能正确判断自身知识边界并在不确定时弃答。文章指出校准所需的计算量远小于追求高准确率,小模型有时更容易做到,例如对不熟悉的语言直接表示不知道。当前准确率主导的评估却不鼓励这种校准行为。

模型校准

为什么语言模型会产生幻觉

预训练阶段模型通过预测下一个词在大量文本上学习,没有真假标签区分有效与无效陈述。文章类比图像识别中预测宠物生日会必然出错,说明预训练无法避免对任意事实的幻觉。文章认为这是幻觉产生的统计根源,后续阶段的校正并不彻底。

预训练

使用 AI 渲染 ASCII 游戏的高保真画面

在本文中,Outpainting 被提出作为解决实时 AI 渲染游戏时帧间一致性问题的潜在方法。它通过利用前一帧生成的图像按移动增量平移,结合当前源帧,并对新增像素应用遮罩来实现。这可能带来更平滑的视觉体验,但受限于当前模型的延迟,无法在所需速度下实现。

Outpainting

使用 AI 渲染 ASCII 游戏的高保真画面

作者尝试了多种 style transfer 模型来改善生成图像的视觉风格,但最终转向自定义 LoRA 训练以获得更贴合的史前地形效果。实验显示,style transfer 在保持布局的同时难以同时满足速度与细节要求,因此未成为实时渲染的最终选择。

Style Transfer

使用 AI 渲染 ASCII 游戏的高保真画面

IP-Adapter 被作者列为实验选项之一,与 LoRA、style transfer 一起尝试,用于增强图像生成中的风格或内容控制。在 image-to-image 流程中,它帮助微调输出与游戏帧的对齐,但最终因速度与效果综合考量,未被选为实时渲染的主力方案。

IP-Adapter

使用 AI 渲染 ASCII 游戏的高保真画面

作者通过 FLUX 模型生成样本后,使用 fal.ai 的 FLUX LoRA Fast Training 训练自定义 LoRA 权重,仅用几分钟和不到一美元成本完成。训练后的 LoRA 在 FLUX LoRA Image to Image 中应用,提升了史前地形风格一致性,但因延迟达 4 秒而无法用于实时游戏,适合离线高质量渲染。

LoRA

使用 AI 渲染 ASCII 游戏的高保真画面

ControlNet 在文中被作者尝试用于控制生成图像的布局一致性,主要测试分割图和轮廓类型,期望通过游戏引擎输出的色块区域引导水、熔岩、草地等元素。实验结果不理想,原因包括区域标签难以准确定义以及块状地形缺乏足够语义信息,最终放弃该方案,转而采用 image-to-image 模型。文章指出即使尝试其他 ControlNet 变体,效果仍不如直接使用源图像作为输入。

ControlNet

使用 AI 渲染 ASCII 游戏的高保真画面

Latent Consistency Models(LCM)是 fal.ai 上用于实现近 100ms 生成速度的模型族,文章中作者选用 fast-lcm-diffusion/image-to-image 端点配合 Stable Diffusion 1.5 进行游戏帧转换。该模型满足实时性要求,但因蒸馏特性导致图像质量和可控选项受限,无法有效使用 ControlNet 或精细风格调整。最终以“top down, rpg terrain map...”提示词生成史前地形,实现了可玩的低延迟渲染。

Latent Consistency Models

Zed 通过 ACP 引入 Gemini CLI

Google 与 Zed 合作,将 Gemini CLI 作为 Agent Client Protocol 的首个参考实现集成到编辑器中。 Gemini CLI 团队主动联系 Zed,寻求比终端更深度的集成方式。 这一合作推动了 ACP 的设计,并验证了其在真实代理上的可行性。

Google

使用 AI 渲染 ASCII 游戏的高保真画面

本文选用 Stable Diffusion 1.5 搭配 fast-lcm-diffusion/image-to-image 端点,作为实时渲染的主力模型。配合“top down, rpg terrain map...”提示词,它能在 100ms 左右生成速度下处理游戏帧,但受限于蒸馏模型能力,无法很好渲染恐龙精灵,且地形细节跳跃问题仍存在。

Stable Diffusion

使用 AI 渲染 ASCII 游戏的高保真画面

本文中 Image-to-Image 模型被用于将 ASCII 游戏帧直接转化为地形图像,以保持布局一致性。作者对比了 ControlNet 方法,发现 i2i 在对齐游戏画面方面效果更好,最终选用 fast-lcm-diffusion/image-to-image 端点搭配 512×512 分辨率,实现了约 10 FPS 的实时渲染,但仍面临强度参数对块状保留与自然度的权衡问题。

Image-to-Image

缩放图像带来 AI 的即时注入风险

本文将 OpenCV 作为典型图像处理库示例,其双三次插值实现存在特定相位与抗锯齿差异。Anamorpher 工具已针对 OpenCV 的双三次下采样实现生成攻击图像,并在图 5 中展示具体像素调整过程。文章指出需先指纹识别各库实现才能成功发动攻击。

OpenCV

缩放图像带来 AI 的即时注入风险

本文将 TensorFlow 列为图像降采样算法的实现库之一,与 Pillow、PyTorch、OpenCV 并列。这些库在抗锯齿、对齐、核相位等方面的差异,直接影响图像缩放攻击的具体手法。作者为此开发指纹识别测试套件,以确定目标系统所用算法和实现,从而针对 Gemini 等生产系统构造有效攻击载荷。

TensorFlow

缩放图像带来 AI 的即时注入风险

本文将 PyTorch 作为常见深度学习库示例,其下采样实现与 Pillow、OpenCV 存在对齐、核相位等差异。文章强调这些实现差异直接影响图像缩放攻击所需的技术手段,需先指纹识别后再选择对应攻击载荷。

PyTorch

FLUX.1 Krea

本文中的 Diffusion Transformer 指 Black Forest Labs 提供的 flux-dev-raw 模型,参数量 120 亿,是经过预训练和 guidance-distilled 的原始基础模型。它具备丰富世界知识、多样输出分布且未被过度微调,成为 FLUX.1 Krea 后训练的理想起点。

Diffusion Transformer

FLUX.1 Krea

本文中 LAION-Aesthetics 被广泛用于筛选高质量训练图像,但存在明显偏好:倾向女性肖像、模糊背景、过度柔和纹理和明亮画面。作者认为尽管可过滤劣质样本,但依赖它会给模型先验加入隐性偏差,导致“AI 味”加重。

LAION-Aesthetics

FLUX.1 Krea

Black Forest Labs 为 Krea 提供 flux-dev-raw 基础模型,这是一个 12B 参数的预训练、指导蒸馏扩散 Transformer。Krea 与其合作开发 FLUX.1 Krea,以实现特定美学目标。该基础模型具备丰富世界知识、基本构图能力和多样输出分布,未经重度微调,适合后续美学导向的后训练。

Black Forest Labs

FLUX.1 Krea

文章提到早期图像生成主要使用 GAN 模型,当时只能生成猫和花等简单内容,远未达到今天模型的连贯性与复杂理解水平。GAN 时代被用来对比当前扩散模型在人脸、手部、文字渲染等方面的进步,同时指出早期模型虽不完美却更具风格多样性。

GAN

FLUX.1 Krea

本文提到用户常依赖LoRA实现特定风格化,因为全局偏好数据易导致构图对称、纹理模糊等问题,提示词难以满足个性化需求。Krea产品界面也提供图像与视频LoRA微调及分享功能,作为后训练之外的实用扩展手段。

LoRA

FLUX.1 Krea

本文中CFG指classifier-free guidance。作者指出flux-dev-raw为guidance-distilled模型,因此设计自定义损失函数,直接在CFG分布上进行微调。这使得FLUX.1 Krea dev能在SFT阶段显著提升图像质量,同时保持与FLUX.1-dev生态的兼容性,专注于美学与真实感输出。

CFG

FLUX.1 Krea

Krea 将 FLUX.1 Krea 模型权重发布在 Hugging Face 平台,用户可直接下载 22GB 文件使用。该平台同时托管 Black Forest Labs 提供的相关基础模型,支持社区下载、微调与集成。

Hugging Face

FLUX.1 Krea

本文中 RLHF 是后训练第二阶段,采用 TPO 偏好优化方法,使用严格筛选的内部人类偏好数据多次迭代,提升模型美学与风格化能力。作者强调数据质量优于数量,并主张采用主观、意见鲜明的审美导向而非混合全球偏好,以避免分布塌陷到平庸结果。

RLHF

FLUX.1 Krea

本文中 SFT 是后训练第一阶段,通过人工精选符合 Krea 审美标准的高质量图像(含 Krea-1 合成样本)进行监督微调,并针对 guidance-distilled 模型设计自定义损失,直接在 CFG 分布上训练。完成后模型图像质量显著提升,但仍需 RLHF 进一步校准美学。

SFT

FLUX.1 Krea

本文指出 CLIP Score 用于预训练阶段评估,而基于 CLIP 微调的多数美学评分器因仅处理 224×224 低分辨率图像且参数有限,已无法匹配当前生成模型的能力。作者强调这些旧评分器会引入偏差,影响训练数据选择和最终输出美学。

CLIP

FLUX.1 Krea

本文中 FID 是预训练阶段用于衡量模型通用性能的指标,在图像仍不连贯时与 CLIP Score 一起评估整体效果。作者指出这类学术指标对后期美学质量评估已不够充分,容易导致模型偏离用户真正想要的视觉风格。

FID

RAG 但是只需使用图像

SigLIP-So400m 是 ColPali 中使用的视觉 Transformer,负责处理页面图像的 patch 并生成同时包含文本与视觉上下文的嵌入。这些嵌入再经 PaliGemma-3B 语言模型精炼,支持 late interaction 检索。Morphik 借助该组件实现了对图表和表格的直接理解,无需单独的文字提取步骤。

SigLIP

RAG 但是只需使用图像

本文引用MUVERA论文解决ColPali多向量检索的性能问题。该方法将多向量搜索转化为固定维度的单向量相似度计算,保留patch间交互信息的同时大幅降低计算量。配合Turbopuffer后,系统查询延迟从3-4秒降至30毫秒,实现了百万级文档的实时检索。

MUVERA

RAG 但是只需使用图像

OCR 在文中被描述为传统文档处理流程的第一步,用于从 PDF 提取文本,但常将数值和标题混淆,尤其在含表格的页面上表现糟糕。即使 OCR 完美识别字符,图表与视觉关系仍会丢失。作者因此主张完全跳过 OCR,直接使用页面图像进行检索。

OCR

RAG 但是只需使用图像

文章介绍 ColPali 模型通过 Late Interaction 机制实现检索:模型不只匹配查询词,而是同时定位包含“Q3”“revenue”等文本的图像 patch,以及图表趋势、表格数据和颜色标记等视觉元素。该机制让系统无需解析即可保留页面空间关系与视觉语义,是视觉文档 RAG 的核心优势。

Late Interaction

开源 LLM 架构比较

本文中,RMSNorm被OLMo 2、Llama、Gemma等模型广泛采用,取代LayerNorm以减少可训练参数。OLMo 2将其置于注意力与FFN之后(Post-Norm风格),并额外添加QK-Norm用于稳定训练,与Pre-Norm的GPT式放置形成对比。

RMSNorm

开源 LLM 架构比较

本文将 RoPE 描述为从绝对位置编码演进而来的旋转位置编码机制,被多数当代 LLM 用于注意力计算中的查询和键向量旋转;部分模型如 Gemma 4、MiniMax-M2 采用 partial RoPE,仅对部分维度应用旋转以减少长序列位置噪声并改善外推能力。

RoPE

开源 LLM 架构比较

MiniMax-M1使用Lightning Attention这一线性注意力变体,显著提升计算效率。相比标准注意力,它在长序列场景下内存和速度优势明显,但MiniMax-M2为追求更高建模性能已回归全注意力机制。

Lightning Attention

开源 LLM 架构比较

本文将 Grouped-Query Attention(GQA)定位为 MHA 的高效替代方案,通过让多个查询头共享同一组键值投影来减少 KV 缓存和参数量;Gemma 3、Llama 4、Qwen3、Mistral 等主流模型均采用 GQA,在保持接近 MHA 性能的同时显著提升推理效率。

Grouped-Query Attention

开源 LLM 架构比较

本文讨论Google的Gemma系列演进。Gemma 3引入5:1滑动窗口注意力与Pre-Post双RMSNorm放置,Gemma 3n添加PLE与MatFormer实现设备端高效。Gemma 4基本延续Gemma 3设计,仅在全局层复用键值并采用25% p-RoPE。文章认为这些设计在保持性能的同时显著降低KV缓存与计算开销。

Google

开源 LLM 架构比较

本文讨论LayerNorm时指出,原始Transformer使用Post-LN放置方式,而多数现代LLM已转向RMSNorm。OLMo 2虽采用RMSNorm,但其Post-Norm变体与传统LayerNorm的Post-LN形成对比,目的是提升训练稳定性。

Layer Normalization

开源 LLM 架构比较

Qwen3-Next用Gated DeltaNet+Gated Attention混合机制替换常规注意力,比例为3:1。Gated DeltaNet属于线性注意力变体,通过delta rule更新快速权重记忆,支持262k原生上下文长度,同时保持较高建模精度。它被视为Mamba的替代方案,能显著降低内存占用。

Gated DeltaNet

开源 LLM 架构比较

本文中Sliding Window Attention将注意力限制在当前token的局部窗口(Gemma 3设为1024 tokens),与全局注意力按5:1比例混合使用。相比Gemma 2的1:1与4096窗口,该设计进一步降低KV cache内存占用,消融实验显示对困惑度影响极小。Mistral Small 3.1默认关闭此机制以优化延迟。

Sliding Window Attention

开源 LLM 架构比较

本文将KV Cache视为推理阶段的主要内存瓶颈。GQA通过共享键值头降低缓存占用,MLA则先将键值压缩到低维空间再存入缓存,解码时再投影回原尺寸。Gemma 3采用滑动窗口注意力进一步缩减缓存,Mistral Small 3.1也通过缩小缓存和层数提升速度。文章对比显示这些方法在保持性能的同时显著降低内存带宽需求。

KV Cache

开源 LLM 架构比较

本文指出 Multi-Head Attention(MHA)是原始 Transformer 的标准注意力形式,各头独立拥有键值投影;OLMo 2 等模型仍保留 MHA,而多数新模型已转向 GQA 或 MLA 以降低 KV 缓存内存占用,MHA 在建模性能上通常优于 GQA 但计算开销更大。

Multi-Head Attention

开源 LLM 架构比较

本文中Pre-LN指将RMSNorm置于注意力与前馈模块之前(Pre-Norm),GPT及多数当代LLM采用此设计。相比原始Transformer的Post-LN,Pre-LN在初始化时产生更稳定的梯度,且无需精心调整学习率预热。OLMo 2等模型的对比实验显示其与Post-Norm变体在训练稳定性上的差异。

Pre-LN

开源 LLM 架构比较

本文中,GELU被描述为早期GPT架构使用的激活函数,已被更高效的SwiGLU所取代。这一替换是LLM从GPT-2到DeepSeek V3、Llama 4等模型演进中的典型优化之一。

GELU

开源 LLM 架构比较

本文中Post-LN指原始Transformer将归一化层置于注意力与前馈模块之后的设计。OLMo 2采用其RMSNorm变体(仍在残差连接内部),实验表明该放置方式有助于提升训练稳定性,与标准Pre-LN形成对比。Gemma 3则在注意力模块周围同时使用Pre-Norm与Post-Norm以兼顾两者优势。

Post-LN

开源 LLM 架构比较

本文中NoPE指No Positional Embeddings,即完全移除显式位置编码的做法。SmolLM3仅在每4层中使用NoPE,依靠因果注意力掩码隐式保留顺序信息。该方法在小模型上展现出更好的长度泛化能力,序列长度增加时性能下降更慢。

NoPE

开源 LLM 架构比较

Multi-Token Prediction让模型在每个位置同时预测多个未来token,而非仅预测下一个。Qwen3-Next、DeepSeek V3、GLM-4.5、Nemotron 3 Super等模型均采用该技术,通过额外线性头输出未来token logits,提升训练信号并支持推测解码。

Multi-Token Prediction

开源 LLM 架构比较

本文提及YaRN作为RoPE的重新缩放技术,用于长上下文扩展。Qwen3-Next原生支持262k上下文,主要依靠Gated DeltaNet混合,而非依赖YaRN;Olmo 3则仅在全局注意力层使用YaRN实现64k扩展。文章指出YaRN能更好保留模型质量,但新架构更倾向通过混合注意力或线性机制减少对其依赖。

YaRN

开源 LLM 架构比较

本文中MatFormer(Matryoshka Transformer)允许Gemma 3n使用单一共享LLM架构,可切分为多个独立可用的较小模型。每一切片均单独训练以支持独立推理,从而在不同资源约束下灵活部署,无需训练多个独立模型。

MatFormer

开源 LLM 架构比较

本文中,Multi-Head Latent Attention(MLA)是DeepSeek V3/R1采用的注意力机制。它通过将键值张量压缩到低维空间再存入KV缓存来降低内存占用,推理时再投影回原尺寸。与GQA和标准MHA相比,MLA在建模性能上更优,且与KV缓存配合良好,DeepSeek-V2已引入该方法。

Multi-Head Latent Attention

开源 LLM 架构比较

本文指出Kimi K2首次在大规模生产模型中采用Muon优化器替代AdamW。该优化器带来了更平滑的训练损失曲线,减少了损失尖峰现象。Muon的使用被视为Kimi K2达到顶级性能的关键训练因素之一。

Muon

开源 LLM 架构比较

本文中,Mixture-of-Experts(MoE)被DeepSeek V3、Llama 4、Qwen3等多模型采用,用多个专家FeedForward层替换单一FeedForward模块。DeepSeek V3每层有256个专家,仅激活9个(含1个共享专家),总参数671B但每次推理仅用37B参数,实现稀疏激活以提升容量与效率。

Mixture-of-Experts

开源 LLM 架构比较

本文中QK-Norm是在多头注意力内部对queries和keys(RoPE前)额外施加的RMSNorm层。OLMo 2将其与Post-Norm结合使用以稳定训练损失,Gemma 3同样采用。代码实现显示其可独立开关,且与标准注意力机制兼容。

QK-Norm

在 OpenAI 工作是什么感受

文章将Google视为OpenAI的主要竞争对手之一,指出其在快速转向决策上不如OpenAI灵活。文中提到OpenAI会密切关注Google的动向,并在AGI赛道上形成三强格局。Google的稳定基础设施风格被拿来对比OpenAI的迭代文化。

Google

在 OpenAI 工作是什么感受

本文脚注中简要提及 Ilya Sutskever,与 Mira 并列,被作者评价为拥有卓越人才。他们所领导的新组织被认为可能改变 AGI 竞赛格局,尽管目前与 OpenAI、Anthropic 和 Google 组成的三强相比仍有追赶空间。作者指出这些人才优势或将带来竞争动态的变化。

Ilya Sutskever

在 OpenAI 工作是什么感受

OpenAI的核心目标是构建AGI,作者视其为最具影响力的工作,远超普通产品开发。目前通往AGI的竞争被描述为OpenAI、Anthropic与Google的三强格局,各方基于自身基因采取不同路径。作者认为LLM是十年间最重要技术创新,而AGI进展将决定未来技术方向。

AGI

在 OpenAI 工作是什么感受

文中以 Andrey 指代 Codex 负责人,他曾向作者强调研究人员应被视为“mini-executive”,鼓励自主探索想法而非等待自上而下的规划。这一观点与 OpenAI 研究团队自下而上、通过“nerd-sniping”驱动项目推进的文化直接相关。

Andrej Karpathy

Gemini Nano 笔记

本文指出 Google 发布的 Gemini Nano 及 Prompt API 文档风格不易理解,因此作者自行重写以适应自身思路。文章说明 Chrome 137+ 开始逐步无标记推送该模型,并对比早期 window.ai 的过度承诺与当前实现差异,强调需手动开启 flag 并下载约 1.5-2.4GB 模型。

Google

为老年用户设计防骗的界面交互

文章在诈骗演变概述中提到,诈骗者借助 AI 与深度伪造视频生成高度逼真的虚假内容,包括模仿亲人声音的音频攻击。作者特别指出这种技术让诈骗更具说服力,老年用户因信任权威或亲人而更容易上当。文中将其视为当前诈骗复杂化的核心技术威胁之一。

Deepfake

学习中文时的 18 条思考

文章讨论学习中文的动机,指出AI虽能快速准确翻译文章,但无法提供语言感觉或实现真实人际交流。目前AI辅助对话受硬件限制,难以支持实时无缝沟通。

Artificial Intelligence

苹果新的基座模型性能如何?

本文所述 AFM-server 采用自定义 Mixture of Experts 架构:先将模型拆分为层组,再把每组拆成并行块,每个块是配备 MoE 层的独立多层 Transformer。与传统 MoE 每层跨设备聚合不同,AFM-server 仅在每个块结束时聚合结果,从而降低通信开销。设备端模型则使用标准 Transformer,未采用 MoE。

Mixture-of-Experts

苹果新的基座模型性能如何?

本文中 AFM-on-device 使用 3 亿参数 Vision Transformer 处理图像输入,AFM-server 则采用 10 亿参数版本。图像先经视觉编码器生成嵌入,再由视觉适配器调整后与文本提示一同送入语言模型。文章未披露视觉适配器的具体架构细节。

Vision Transformer

苹果新的基座模型性能如何?

本文中,苹果团队采用量化感知训练方法,在训练阶段模拟量化效果,从而将AFM-on-device模型压缩至每权重2比特(嵌入层为4比特)。该技术有效降低了模型推理时的内存占用,同时保持了较好的性能表现。压缩后的模型仍能支持文本和图像输入,服务于设备端AI任务。

Quantization Aware Training

苹果新的基座模型性能如何?

本文中Google及其Android平台被提及正在AI领域加速前进,发布新模型和功能以超越苹果。Google的进展与苹果Siri升级延迟、iPhone AI功能不足形成对比,凸显苹果在生成式AI竞争中的落后处境。

Google

将 iPhone 8 改造成太阳能驱动的 OCR 服务器

本文中 OCR 指利用 Apple Vision 在 iPhone 8 上进行的本地文本识别任务,服务于独立图像分类项目。经过一年运行累计处理 83418 次请求和 48GB 图像,峰值日超 1000 次,相比云服务节省 83-125 加元费用,同时避免隐私泄露,成为太阳能供电服务器的核心应用场景。

OCR

缓一缓

文中将该困境类比为工程实践中持续修复当前bug与停下来反思是否应换方向之间的张力。作者认为两者难以同时兼顾,执着推进是工程师的重要特质,但过度投入又可能导致方向错误。没有简单方法判断何时该后退一步。

Exploration-Exploitation Dilemma

Demis Hassabis 谈 AGI

本文中AlphaEvolve是DeepMind最新推出的Gemini驱动编码代理,通过让模型生成程序与数学函数假设,再结合进化编程流程筛选最优解,实现芯片设计、数据中心任务调度和矩阵乘法证明等应用。它被描述为自动化AI研究的早期形态,能在数学和编码等可验证领域探索新思路,标志着从增量改进向自主创新的迈进,与AGI路线图直接相关。

AlphaEvolve

Demis Hassabis 谈 AGI

本文中AGI指人工通用智能,即达到人类水平的人工智能系统。过去谷歌高管较少公开讨论,但本周Google I/O大会上,领导层公开预测其即将到来,并强调其将带来广泛影响。Demis Hassabis认为AGI需具备人类大脑的所有能力、真正原创发明和高度一致性,时间线大致在2030年前后,当前系统在创造力和一致性上仍有差距。

AGI

Demis Hassabis 谈 AGI

文章中Monte Carlo Tree Search被列为与强化学习、规划技术并列的方法,能帮助当前模型跳出现有知识边界,探索新解空间。它与进化方法共同构成AlphaEvolve等系统超越单纯统计生成的关键组件,支撑Hassabis对AI创造力的论述。

Monte Carlo Tree Search

Demis Hassabis 谈 AGI

Google DeepMind是谷歌的AI研发核心团队,由Demis Hassabis领导,2014年通过收购加入谷歌。本文称其为“谷歌的引擎室”,负责Gemini模型开发、AlphaFold等突破性项目,并推动公司整体向AGI方向转型。团队同时开展基础研究与产品应用,强调通过规模化与专业化结合加速进展。

Google DeepMind

从零开始的向量搜索引擎

文章在“未来想法”部分提出 TF-IDF 作为余弦相似度方法的改进方向。它可过滤文档集中常见词的噪声,突出各文档特有词汇,从而提升搜索的相关性排序效果。

TF-IDF

从零开始的向量搜索引擎

本文共同作者,指导 Max Bernstein 完成搜索引擎开发,因后者此前对 word2vec 了解有限。他提供了 12MB 的 word2vec.pkl 文件,参与设计索引与网页端按需加载方案,并建议评估时挑选有利示例以展示效果。

Chris Gregory

从零开始的向量搜索引擎

文章提到欧氏距离可作为向量比较的备选方案,它衡量空间中两向量的实际距离,但作者最终未选用,因为它无法像余弦相似度那样忽略长度差异。

Euclidean Distance

从零开始的向量搜索引擎

本文使用预训练的Word2vec模型(前10000个常用词的300维向量,存储为12MB pickle文件)作为核心,将每个博客文章的词向量相加得到文档嵌入,用于后续搜索匹配。

Word2vec

从零开始的向量搜索引擎

本文采用余弦相似度比较查询嵌入与各文章嵌入的夹角,用于对搜索结果排序;相比欧氏距离,它能忽略向量长度,只关注方向比例,从而更好地反映语义相似性。

Cosine Similarity

从零开始的向量搜索引擎

文章中Word Embedding指将单词映射到300维空间的函数,通过查找字典并对文章或查询中的词向量求和来生成整体表示,再用余弦相似度进行排序。

Embedding

Nintendo 64 上的利用调色板模拟光照

本文通过K-means聚类将漫反射纹理与法线贴图压缩到同一16色或32色调色板,并强制两者共享调色板索引。着色时仅遍历调色板条目即可同时读取法线与颜色并输出着色后的新颜色,实现CPU端的纹理空间光照更新。

K-means Clustering

Nintendo 64 上的利用调色板模拟光照

文章使用scikit-learn的K-means算法,将漫反射纹理与法线贴图视作单张六通道图像进行聚类,生成共享调色板索引。该索引使同一调色板既能存储表面颜色又能存储物体空间法线,从而只需一次4bpp图像数据即可同时支持两种贴图的调色板着色。

scikit-learn

Google 医疗诊断对话模型水平超越大多数初级保健医生

Google DeepMind的研究科学家Khaled Saab等参与本文工作,负责多模态AMIE的系统设计与评估。该团队与Google Research联合完成研究,贡献了状态感知框架和模拟评估环境。文章明确标注DeepMind为主要合作方之一。

Google DeepMind

将代码编译成诗歌和艺术

本文指出作者创作探索人工智能,HyperDog项目中用户填写属性后生成Java代码并转化为二进制狗的流程,反映了AI与编程语言对感知的影响。作品通过代码到数字生命的转化,体现人工智能作为叙事工具的潜力,让抽象算法获得具象生命力。作者将此与个人从代码到艺术的转变相连,强调科技方法论对表达的塑造。

Artificial Intelligence

AI 时代做设计

文章主题围绕人工智能时代的设计展开,指出传统确定性界面已无法适应 AI 的不可预测性。作者认为设计需为 AI 提供明确的形式与上下文,否则 AI 将像无岸之河般失去方向。文中强调,未来需重新发明设计流程,先探索 AI 能力,再反向塑造产品形态。

Artificial Intelligence

突破 Gemini 的沙箱

Google在本报告中既是漏洞悬赏主办方,也是被测试对象。他们提前开放Gemini预览版及文档,组织LLM bugSWAT活动,并安排安全团队复审研究者提交的proto泄露问题。最终确认部分安全proto因构建流程误包含在沙箱二进制中。

Google

AI 幻觉设计指南

本文说明LLM Temperature是API中控制生成随机性的参数。低温度使输出更接近训练数据但可能导致抄袭,高温度则允许更多意外结果;降低温度虽减少幻觉,却会增加“我不知道”回答,降低实用性。

LLM Temperature

AI 幻觉设计指南

本文将Transformers列为当代主流生成式AI架构之一,与LLM共同构成幻觉问题的技术根源。由于Transformer-based模型难以输出决策因素,文章指出可解释AI方法在此类系统上应用受限。文章提到,当前工程手段如温度调节或RAG仍无法完全消除Transformers带来的幻觉问题。

Transformers

AI 幻觉设计指南

本文指出,当AI系统能提供预测时最具影响力的数据因素(即Explainable AI)时,可在低置信度输出下方显示明确警告。但文章强调,这种方法在基于Transformer的LLM中通常难以实现,仅适用于传统机器学习分类系统。

Explainable AI

AI 幻觉设计指南

本文将Multiagent Debate描述为多响应技术的一种变体:系统将同一提示发送给多个AI模型,各模型分别生成回答并可相互辩论。通过对比不同模型输出的一致性,帮助用户识别潜在幻觉。

Multiagent Debate

AI 幻觉设计指南

本文将AI幻觉定义为生成式AI产出看似合理但实际错误或无意义的内容,包括虚假事实陈述和图像畸变。文章通过ChatGPT错误引用76%的新闻引文、法律AI工具六分之一查询出错等案例,说明幻觉常以自信语气呈现,难以被用户识别。其根本原因是AI仅基于统计概率生成输出而非追求真实性,属于当代AI技术的固有特征而非bug。文章强调设计师需通过界面模式帮助用户识别并应对幻觉,以建立信任。

大模型幻觉

不要滥用余弦相似度

文中建议用生成的数据训练定制嵌入时,可选择PyTorch、TensorFlow等框架实现矩阵分解与模型优化。这些框架用于将通用嵌入转换为针对具体相似度定义的投影矩阵,解决余弦相似度无法直接满足业务需求的问题。

TensorFlow

不要滥用余弦相似度

本文指出皮尔逊相关系数相当于先对向量去均值再计算余弦相似度。当向量已中心化且归一化时,两者完全等价。文章认为若余弦相似度适用,皮尔逊相关系数同样可用,且在训练时可直接用点积替代,避免重复归一化。

皮尔逊相关系数

不要滥用余弦相似度

Word2Vec是本文提及的早期词向量模型,作者引用其经典示例说明向量能发现词间关系。文章将其作为嵌入概念的起点,扩展到句子嵌入的应用与局限讨论,体现将事物转为向量的趋势。

Word2vec

不要滥用余弦相似度

Piotr Migdał是本文作者,他在文章中探讨了余弦相似度在AI嵌入向量中的应用问题,指出其作为“duct tape”的便利性与局限性。通过示例和分析,他强调需根据模型训练方式和实际需求谨慎使用,并提出替代方案。

Piotr Migdał

不要滥用余弦相似度

本文中嵌入向量指通过LLM生成的句子表示,能捕捉文本语义本质。作者以Python相关句子为例,展示其在余弦相似度计算下的表现优于字符串相似度,但也指出可能匹配错误类型的问题。文章讨论了如何针对特定任务优化嵌入以改善效果。

Embedding

不要滥用余弦相似度

本文以 glove.6B.300d 词向量为例,展示余弦相似度对“dog”的最近邻与最远邻查找结果。文章强调高维空间中几何直觉失效,并提供 Colab 笔记本供读者用 PyTorch 复现实验,说明余弦相似度在词向量上的典型用法与局限。

GloVe

不要滥用余弦相似度

本文在自定义嵌入训练公式中引入 sigmoid 函数,将查询与答案的点积转为概率,用于学习非对称相似度。该公式通过两个独立矩阵把嵌入映射到不同空间,适用于“问题-答案”匹配或 RAG 场景,比直接用余弦相似度更贴合实际需求。

Sigmoid 函数

不要滥用余弦相似度

文中以VGG-16图像检测模型为例,作者曾从其分类层取出logit向量,并用Pearson相关系数寻找相似图像。该做法被描述为一种临时hack,仅在早期模型中尝试过,效果有限且缺乏理论保障,反映了余弦相似度之外的相似度度量尝试。

VGG-16

不要滥用余弦相似度

文章把微调描述为“教老模型新把戏”,即通过调整模型权重来生成面向具体任务的嵌入。与迁移学习不同,微调直接修改底层参数,适用于有模型访问权限且需深度适配的场景,用于解决余弦相似度匹配类型与实际需求不符的问题。

微调

不要滥用余弦相似度

本文将迁移学习定义为利用已有模型知识创建更专注的新嵌入的方法,与微调并列为两种任务特定嵌入方案。通过在原始嵌入后乘以可训练投影矩阵,可在保留模型原有能力的同时,针对“问题-答案”匹配等特定关系进行优化。

迁移学习

不要滥用余弦相似度

莱文斯坦距离在本文示例中用于计算字符串编辑距离,显示句子A与B仅差2字符而与C相差21字符,与语义相似度结果相反。作者借此对比说明嵌入向量结合余弦相似度更能反映含义而非表面形式。

莱文斯坦距离

不要滥用余弦相似度

本文将余弦相似度描述为向量比较的便捷工具,常用于嵌入向量的相似度计算,但作者警告其易被误用,尤其当模型训练目标并非此指标或所需相似类型不匹配时。文章通过句子示例说明其可能匹配问题而非答案,或受表面特征影响。作者建议根据具体任务优化或使用其他方法。

Cosine Similarity

不要滥用余弦相似度

Node2Vec是本文列举的图结构嵌入方法之一,与Word2Vec等并列,体现作者所言“只要能命名,就能转成vec”的趋势。文章以此引出嵌入在关系发现中的作用,但未深入其具体应用细节。

Node2Vec

不要滥用余弦相似度

本文建议用 PyTorch 等框架训练自定义嵌入,通过矩阵变换和 sigmoid 函数把通用向量映射到任务特定空间。该方法可针对问答匹配或 RAG 场景优化相似度,而非直接使用余弦相似度,文章还附带矩阵分解练习笔记本供入门。

PyTorch

什么是文本嵌入

本文详细说明注意力机制为每个词元学习value、query和key三类向量,通过query与key的接近度决定其他词元value被加权的程度。文章用“语义管道”类比形象解释:key向量决定输出端,query向量决定输入端,从而实现词元间的灵活信息流动。该机制使Transformer能并行建模任意距离依赖。

Attention Mechanism

什么是文本嵌入

本文将循环神经网络(RNN)描述为处理文本序列的基本架构,每个词元依次将自身嵌入与前序信息结合,最终用最后一个词元的表示作为整个序列的嵌入。简单全连接RNN通过这种逐步累积方式建模序列,但受限于无法并行计算。文章指出该结构是通向LSTM和Transformer的起点,用于捕捉词序信息。

Recurrent Neural Network

什么是文本嵌入

本文将三元组损失定义为神经网络训练嵌入时的核心目标:在每步比较锚点、正例(应靠近)和负例(应远离),最小化锚点与正例距离、最大化与负例距离。无需真实距离标签,仅用二元代理即可从大量数据中学习有效信号。文章指出此方法突破了LSA等传统算法限制,使嵌入能更好地反映语义相似性。

三元组损失

iOS 18 中的同态加密

本文中,服务器在初始化阶段使用K-means Clustering将图像嵌入向量按相似度分组,形成多个文档簇。该方法用于非私有基线搜索流程,后续结合同态加密等技术实现隐私保护搜索。更多簇可提升性能、缩小单次搜索范围,但也增加选错簇的风险,导致匹配准确率下降。

K-means Clustering

什么是文本嵌入

本文以Word2vec为例说明词嵌入方法:通过滑动窗口在原始文本上采样上下文,将共现词向量拉近,实现无需标注的训练。著名案例显示其支持向量算术,如king-man+woman≈queen。文章强调该方法仅用大规模原始语料即可捕捉丰富语义,但仍局限于单词层面,需后续序列模型处理完整句子含义。

Word2vec

什么是文本嵌入

文章指出全连接RNN存在梯度消失问题:早期词元参数在多层小数权重累积后影响趋近于零,导致训练时无法有效更新。由此难以建模长距离依赖,如句子中相隔较远的“狗”和“比赛”之间的关系。梯度消失被视为RNN处理长文本的主要瓶颈。

梯度消失

什么是文本嵌入

本文介绍潜在语义分析(LSA)通过对词-文档矩阵进行奇异值分解,推断潜在主题,实现降维与语义捕捉。它仍广泛用于文章页脚的“阅读下一篇”推荐,但受限于需较长文档、无法利用词序及复杂语义。文章将其与LDA并列为早期从词袋模型到嵌入空间的过渡方法。

潜在语义分析

什么是文本嵌入

文章提及BERT作为掩码模型的代表,使用特殊[CLS]或[MASK]词元来汇总整个序列的嵌入表示。它与GPT等自回归模型同属Transformer架构,但训练目标是预测被隐藏的词元。文中指出这类模型的嵌入可直接用于下游任务或作为相似度计算基础。

BERT

什么是文本嵌入

文章将Transformer描述为当前LLM核心架构,通过注意力机制并行处理序列,克服LSTM的顺序计算限制。它可堆叠多层注意力,每层都让词元相互贡献语义信息。文中强调其既能捕捉复杂句法语义,又支持用海量文本进行掩码预测训练,性能随参数和数据规模持续提升。

Transformers

什么是文本嵌入

文章将文本嵌入定义为把一段文本投影到高维潜在空间中的向量,通常维度为768或1536。通过这种表示,语义相似的句子在空间中距离更近,从而支持搜索、垃圾邮件过滤、内容审核等任务。作者强调它能让深度学习模型的语言理解能力以向量形式存储和复用,无需每次都依赖GPU计算。

Embedding

什么是文本嵌入

本文将词袋模型描述为最简单的文本表示方法,仅统计词汇出现次数并映射到坐标轴(如猫轴与狗轴),忽略词序与上下文。用于早期推荐系统时,通过计算欧氏或余弦距离寻找相似书籍,但面临高维稀疏问题。文章指出其作为LSA、LDA等潜在语义方法的输入基础,难以捕捉复杂句法与语义。

词袋模型

什么是文本嵌入

文章中自然语言处理是作者过去四年专注的领域,文本嵌入被视为该领域最基础的概念。它帮助开发者通过向量距离快速实现分类与检索功能,同时为模型性能提供直观判断依据。作者认为良好的嵌入直觉能显著提升NLP模型在实际产品中的集成效果。

Natural Language Processing

什么是文本嵌入

本文介绍LSTM通过引入长期记忆单元和门控机制缓解RNN的梯度消失问题,使信息能稳定向前传递。文章同时指出其仍需按顺序逐词元计算,无法在GPU上高效并行,成为大规模训练的瓶颈。LSTM被定位为Transformer出现前的主流序列建模方案。

长短期记忆网络

什么是文本嵌入

本文提及隐含狄利克雷分布(LDA)利用狄利克雷过程从大量文档中推断潜在主题,实现与LSA相似的降维效果。两者均适用于主题建模场景,但同样受制于文档长度要求及对词序的无感。文章强调它们在捕捉宽泛话题性方面仍有价值,却难以处理细粒度语义与句法结构。

隐含狄利克雷分布

什么是文本嵌入

本文以图书馆书架为例说明余弦距离:在词袋模型中,通过将猫狗词频分别除以总和实现归一化,将向量投影到单位圆上,从而测量角度相似度而非绝对大小。这避免了高频书籍被错误靠近的问题,更适合捕捉相对偏好。文章将其与欧氏距离并列为嵌入空间中最常用的两种度量方式之一,用于判断文本语义相似度。

余弦距离

iOS 18 中的同态加密

本文将嵌入向量定义为图片概念的数值表示,用于通过余弦相似度比较图像语义接近度。向量维度极高,单维度可对应“狗-like”等属性,设备先计算本地照片向量,再用同态加密发送至服务器完成大规模数据库匹配。文章指出直接发送向量会泄露用户拍摄内容,故必须在加密域内完成距离计算。

Embedding

使用 MidJourney 生成一致性插画

Style Reference (--sref) 是 Midjourney 的风格引用功能,作者用它加载多张 Lemonade 官方插图作为参考,涵盖结构形状、圆角形式、深度与线条断裂等元素。这显著提升了 AI 在不同物体(建筑、动物等)上输出风格统一度的能力,解决了早期提示词一致性不足的问题。

Style Reference (--sref)

完美主义与创造力

文章提到人工智能时代与Photoshop类似,能快速制造视觉完美效果,但结果往往缺乏灵魂,使视觉领域趋于同质与乏味。这促使创作者回归模拟、手工与不完美的技巧,以恢复作品的人性化与独特个性。

Artificial Intelligence

Google Material 设计语言的发展

文章在展望Material Design未来时指出,界面可通过人工智能实时读取用户情绪状态,从平静到高能量,并即时生成相应响应,实现数字体验随心情变化。人工智能被视为推动超个性化软件时代的关键辅助技术,让设计系统更具适应性和情感连接,而非仅依赖静态设置。

Artificial Intelligence

Google Material 设计语言的发展

Google 是 Material Design 的推动者,本文指出其早期产品缺乏跨平台一致性,依赖算法而非人文视角设计。通过 Material,Google 改变了自身对设计的认知,从 A/B 测试转向本体论思考,产品如 Android 与网页生态得以统一,内部文化也更重视设计价值。

Google

TRANSFORMER EXPLAINER

本文指出Transformer是一种神经网络架构,2017年后成为深度学习主流,用于文本生成、图像识别和蛋白质预测等多个领域。它通过自注意力机制实现next-token预测,能有效捕捉长距离依赖。GPT、Llama和Gemini等模型均以此架构为基础。

Transformers

TRANSFORMER EXPLAINER

本文中Dropout被列为Transformer的辅助架构特性,是训练阶段防止过拟合的正则化手段。它在掩蔽自注意力计算的softmax之后随机将部分权重置零,迫使模型学习更鲁棒的特征;推理时则关闭该机制,相当于集成多个子网络,从而提升泛化能力。

Dropout

TRANSFORMER EXPLAINER

本文将Temperature定义为控制生成随机性的超参数:输出logits除以该值。等于1时无影响,小于1使分布更尖锐、输出更确定,大于1则使分布更平滑、增加生成多样性与“创造力”。

LLM Temperature

TRANSFORMER EXPLAINER

文章说明Transformer Explainer的GPT-2模型直接源自Andrej Karpathy的nanoGPT项目。该项目提供了清晰的PyTorch实现,经转换后支持浏览器内运行,成为可视化工具的核心模型基础。

Andrej Karpathy

TRANSFORMER EXPLAINER

本文描述Softmax在两个位置发挥作用:一是在掩码自注意力中将缩放后的注意力分数转为概率分布,每行之和为1;二是在输出层把logits转换为词汇表上的概率分布,用于采样下一个token。

Softmax

TRANSFORMER EXPLAINER

本文指出Layer Normalization在每个Transformer块中应用两次,分别在自注意力前和MLP前。它对特征维度做归一化,稳定训练过程、加快收敛,并缓解内部协变量偏移,使模型对初始权重更不敏感。

Layer Normalization

TRANSFORMER EXPLAINER

Embedding 将用户输入文本转换为模型可处理的数值向量表示,具体流程包括 tokenization、获取 token embedding、加入位置编码并求和。GPT-2 的 embedding 矩阵形状为 (50257, 768),约含 3900 万参数,使语义相近的 token 在高维空间中距离更近。该表示同时捕捉语义与位置信息,是 Transformer 处理输入的第一步。

Embedding

TRANSFORMER EXPLAINER

MLP 层在自注意力之后对每个 token 独立处理,由两个线性变换和 GELU 激活组成。第一层将维度从 768 扩展至 3072,第二层压缩回 768,以增强表示能力。与跨 token 整合信息的注意力机制互补,MLP 负责在更高维空间中提炼每个 token 的非线性特征,提升模型整体容量。

MLP

TRANSFORMER EXPLAINER

Tokenization 将输入文本拆分为单词或子词形式的 token,并分配唯一 ID。GPT-2 词汇表包含 50257 个 token,例如 "Data" 和 "visualization" 对应单个 token,而 "empowers" 被拆成两个。该步骤为后续 embedding 提供输入,是将文本转为模型可计算形式的第一阶段。

Tokenization

TRANSFORMER EXPLAINER

本文提到ResNet是2015年首次提出残差连接的模型,这一创新彻底改变了深度学习训练方式,使得极深网络成为可能。Transformer Explainer正因继承了这一思想,才能在GPT-2的12个块堆叠结构中保持梯度有效流动。

ResNet

TRANSFORMER EXPLAINER

本文提到《Attention is All You Need》是2017年发表的开创性论文,首次提出了Transformer架构。该论文奠定了后续所有主流大模型的基础,本文以此作为理解GPT-2等模型的起点。

Attention is All You Need

TRANSFORMER EXPLAINER

本文中GELU是Transformer块内MLP层的激活函数,位于两个线性变换之间。第一个线性层将维度从768扩展至3072,第二个再压缩回768,GELU在此过程中引入非线性,帮助模型捕捉更复杂的特征表示。

GELU

TRANSFORMER EXPLAINER

ONNX Runtime在本文中负责将nanoGPT的PyTorch模型转换为可在浏览器直接执行的格式。它实现了无缝的客户端推理,使输入文本、温度调节和注意力可视化等交互功能能够实时响应并更新数值结果。

ONNX Runtime

TRANSFORMER EXPLAINER

Multi-Head Self-Attention 是 Transformer 块的核心,通过 12 个并行注意力头从不同角度捕捉 token 间关系。计算流程包括生成 Q、K、V 矩阵、分割多头、执行 masked self-attention(点积、缩放、掩码、softmax),最后拼接输出。它让每个 token 表示受上下文影响,有效建模长程依赖并支持并行学习多样语言特征。

Multi-Head Self-Attention

TRANSFORMER EXPLAINER

Positional Encoding 为序列中每个 token 添加位置信息,使模型能区分不同顺序。GPT-2 通过从头训练得到位置编码矩阵,并直接融入训练过程。该编码与 token embedding 相加后形成最终输入表示,帮助模型理解 token 在提示中的相对位置。

Positional Encoding

TRANSFORMER EXPLAINER

文章指出,Transformer Explainer 所使用的 GPT-2 模型源自 Andrej Karpathy 的 nanoGPT 项目,该项目采用 PyTorch 实现 GPT 模型。之后模型被转换为 ONNX Runtime 格式,以便直接在浏览器中执行推理与可视化。

PyTorch

TRANSFORMER EXPLAINER

文章指出残差连接最早用于解决深层网络训练难题,在GPT-2的每个Transformer块中各使用两次(注意力与MLP前后各一次)。它通过将输入直接加到输出上形成跳跃连接,使梯度能更顺畅地反向传播,避免梯度消失,从而支持堆叠12个块的模型稳定训练。

Residual Connections

TRANSFORMER EXPLAINER

本文介绍的Transformer Explainer是一个交互式可视化工具,能实时展示大语言模型中Transformer的工作流程。它基于GPT-2 small模型(1.24亿参数)在浏览器中运行,支持用户输入文本、调整温度和采样参数,并查看注意力权重与输出概率分布。工具由Georgia Tech团队开发,旨在帮助理解嵌入、注意力机制和MLP等核心组件。

Transformer Explainer

AI 衔尾蛇问题

模型崩溃指AI模型因合成数据递归训练而迅速退化的现象,表现为方差丧失、多数群体过度代表、最终输出重复短语或无意义内容。Nature研究显示其发生速度与模型设计缺陷及数据质量直接相关,早期已出现少数群体消失,后期则全面崩溃。这成为生成式AI依赖合成数据时的根本隐患。

Model Collapse

AI 衔尾蛇问题

Emily Wenger在Nature配套文章中指出,模型崩溃带来先发优势:使用AI前互联网数据的公司模型更贴近真实世界。她通过狗品种图像实验显示,常见类别主导后最终图像解体,强调合成数据对生成式AI生态的长期影响。

Emily Wenger

提及人工智能可能会降低购买意愿

本文研究发现,在产品描述中提及“人工智能”会降低消费者的情感信任,进而减少购买意愿。实验中,研究人员对比了相同智能电视描述,仅一组加入AI字样,结果显示该组购买意向明显下降。对于高风险产品如昂贵电子产品、医疗设备或金融服务,这种负面影响更为显著。研究建议营销人员避免在描述中使用AI相关词汇,以免损害销售。

Artificial Intelligence

用户界面密度

Google在文中被用作高价值密度的典型:其2001年首页仅有一个搜索框,利用链接信息实现聚合,却远比Yahoo稀疏。用户能快速获得所需结果,估值从2004年230亿美元增长至超2万亿美元,接近百倍提升,体现其设计方法在价值输出上的优势。

Google

OpenAI 模型行为规范

本文介绍Model Spec是OpenAI发布的首份草案文档,用于明确模型在OpenAI API和ChatGPT中的行为规范。它包含目标、规则和默认行为三部分,用于指导模型在冲突场景下的取舍,并作为RLHF训练和未来模型开发依据。OpenAI计划通过公开反馈持续迭代该规范,以提升模型行为透明度。

Model Spec

Apple 宣布将推出全新辅助功能

设备端机器学习用于眼动追踪和非典型语音倾听功能,所有设置、校准和语音模式识别数据均安全保存在设备本地,不会上传至 Apple。它让眼动追踪无需额外硬件即可在 iPadOS 和 iOS 应用中运行,同时帮助识别因脑性麻痹或中风等影响的个性化语音模式,提升隐私保护与辅助精度。

设备端机器学习

OpenAI 模型行为规范

本文说明Model Spec将作为强化学习从人类反馈(RLHF)的指导原则,供研究人员和AI训练师使用。OpenAI还计划探索让模型直接从Model Spec中学习,以更高效地塑造期望行为。该规范是RLHF流程的重要输入之一。

RLHF

提示工程进阶 - 新加坡政府科技局组织的首届 GPT-4 提示工程大赛冠军 Sheila Teo

NVIDIA团队开发的NeMo Guardrails允许编程方式配置LLM对话流程,并在不同阶段设置动态规则。文章推荐其作为实现系统提示中操作边界动态调整的开源工具。

NeMo Guardrails

LLMs: RAG vs. Fine-Tuning

Phil Winder是本文作者及Winder.ai CEO,在文章中分享RAG与微调对比的演讲内容。他通过实验和论文分析,推荐RAG为主、微调为辅的策略。文中强调其在AI咨询项目中积累的经验,聚焦私有数据集成问题。

Phil Winder

LLMs: RAG vs. Fine-Tuning

本文指出微调通过调整LLM权重来添加领域术语和风格,但容易导致过拟合或丢失原有知识。实验显示仅用微调进行问答效果通常不如RAG,需高质量QA对训练数据才能发挥作用。

微调

如何创建 Google

Google由拉里·佩奇和谢尔盖·布林创办,最初只是改善搜索排序的项目,最终成为市值超万亿美元的公司。本文用其例子说明优秀初创公司往往源于个人兴趣项目而非刻意创业。

Google

RAG 指南 - Prompt Engineering Guide

本文在Modular RAG与Advanced RAG预检索阶段提到混合检索(hybrid search),结合关键词检索与语义检索;适用于不同查询类型,能同时获取精确匹配与上下文丰富的文档,提升召回与精度。

混合检索

RAG 指南 - Prompt Engineering Guide

本文说明RAG索引阶段将文档块转化为嵌入向量存入向量库,查询也需生成嵌入以进行相似度检索;提到可微调嵌入模型或采用动态嵌入(如text-embedding-ada-002)以优化上下文质量。

Embedding

RAG 指南 - Prompt Engineering Guide

本文指出在Advanced RAG中可对嵌入模型进行微调以提升检索相关性,也可通过LLM反馈信号微调检索器;同时对比了RAG与微调的适用场景,RAG用于整合新知识,微调则优化内部知识、输出格式与指令遵循能力,二者可互补迭代使用。

微调

a16z: 消费端 TOP 100 AI 应用

本文将Hugging Face列入生成式AI消费网页产品Top 50,网址huggingface.co,显示其作为模型与应用平台在消费者端的流量排名。

Hugging Face

RAG 指南 - Prompt Engineering Guide

本文介绍HyDE方法:先生成查询的假设性答案,将其嵌入后检索相似真实文档,而非直接用原查询;属于查询改写与对齐策略,可改善检索相关性,文中多次引用其在RAG中的应用。

HyDE

Gemini Pro 1.5 令人印象深刻的视频处理能力

文章引用Gemini技术报告说明,模型先将视频拆成每秒一帧的图像,再按多模态方式处理。作者通过单帧图像实验验证每帧约258 token的消耗,确认视频输入本质上是多模态图像序列的连续推理。

Multimodal

Google 推出开源模型 Gemma

文章将Transformers列为Google长期向开放社区贡献的创新成果之一,与本次发布的Gemma同属推动AI普及的技术脉络。它体现Google持续开放模型与工具的传统,Gemma的发布正是这一历史延续的最新实例。

Transformers

Google 推出开源模型 Gemma

文章说明 Gemma 已与 Hugging Face Transformers 集成,开发者可直接使用该平台进行模型下载、推理与微调,扩展生态兼容性。

Hugging Face

Gemini Pro 1.5 令人印象深刻的视频处理能力

文中作为Gemini Pro 1.5的发布方,提供了100万token模型及视频处理能力,并通过Google AI Studio界面让用户上传视频测试书目提取等任务,突显其在多模态LLM上的最新进展。

Google

Google 推出开源模型 Gemma

本文指出 Gemma 通过原生 Keras 3.0 提供推理与监督微调工具链,支持 JAX、PyTorch、TensorFlow 多框架,帮助开发者快速适配模型进行任务微调。

Keras

Roblox 如何实现实时翻译

Roblox采用基于Transformer架构构建统一翻译LLM,取代256个独立语言对模型。该设计利用语言间相似性提升训练效率,通过专家激活机制处理任意语言对翻译,同时支持源语言自动检测与混合语言输入场景。

Transformers

Roblox 如何实现实时翻译

文章描述Roblox在蒸馏后对模型应用量化等服务端优化,将10亿参数模型压缩至不到6.5亿参数。这一措施显著提升了推理速度,满足约100毫秒的实时聊天翻译延迟要求,同时保持对16种语言的翻译准确性。量化是整体服务优化的一部分,用于支撑海量并发体验。

模型量化

Google 推出开源模型 Gemma

TensorFlow被列为Google过去向开源社区贡献的重要框架之一,本文提到Gemma支持通过TensorFlow/Keras 3.0进行推理与微调。文章将其作为Google开放AI生态的代表,说明Gemma可在该框架下便捷部署,延续了TensorFlow的开放精神。

TensorFlow

Google 推出开源模型 Gemma

Gemma 模型权重托管于 Kaggle,同时提供现成笔记本、免费访问及商用许可条款,方便开发者下载、运行和负责任地分发模型。

Kaggle

Roblox 如何实现实时翻译

Roblox先训练10亿参数的大型翻译模型作为教师,再通过学生-教师方法蒸馏出轻量学生模型。该架构让单一模型处理任意语言对互译,避免了256个独立模型的资源开销,同时借助语言间相似性提升训练效率,最终服务于实时聊天翻译场景。

教师-学生模型

Google 推出开源模型 Gemma

本文中 TensorRT-LLM 是 Gemma 模型的集成工具之一,用于支持推理与微调流程。它与 Hugging Face、NVIDIA NeMo 等工具共同帮助开发者快速上手 Gemma,提供跨框架的部署支持,与主题“开源模型工具链”直接相关。

TensorRT-LLM

Google 推出开源模型 Gemma

文章提及JAX是Google开源的重要技术之一,同时指出Gemma模型提供JAX框架下的推理与监督微调工具链,支持开发者在主流框架中便捷使用。

JAX

Google 推出开源模型 Gemma

文章说明Gemma支持PyTorch原生框架,提供推理与微调的参考实现,与JAX、TensorFlow共同构成多框架工具链,方便开发者根据偏好选择使用。

PyTorch

Google 推出开源模型 Gemma

Google DeepMind与Google其他团队共同开发了Gemma模型,负责将Gemini背后的研究成果转化为轻量级开放版本。文章强调其在模型设计、安全评估和工具发布中的核心作用,确保Gemma符合Google的AI原则并支持负责任的开发者应用。

Google DeepMind

Google 推出开源模型 Gemma

文章将BERT列为Google早期向开放社区贡献的标志性模型,与Gemma同属Google开放AI技术的系列举措。它体现Google长期坚持开源的做法,Gemma的发布延续了BERT等项目推动开发者与研究者共同进步的传统。

BERT

Google 推出开源模型 Gemma

本文提到,Gemma 在指令微调阶段采用大量微调结合强化学习来自人类反馈(RLHF),目的是让模型输出更符合负责任行为准则。该方法与训练集自动过滤敏感信息共同构成 Gemma 的安全对齐策略,支撑其通过人工红队测试和对抗评估。RLHF 帮助 Gemma 在保持高性能的同时降低危险活动能力风险,是其“Responsible by design”核心技术之一。

RLHF

Roblox 如何实现实时翻译

文中提到请求经缓存检查后送入模型服务器时采用动态批处理,以高效处理多语言翻译请求。该机制与嵌入缓存层配合,进一步降低多目标语言翻译时的计算开销,支持平台每日7000万用户同时进行的实时聊天翻译。

动态批处理

你不能让 ChatGPT 连续重复一个词了

Google DeepMind的研究人员在本文中开发并使用了攻击方法。他们让ChatGPT-3.5-turbo反复输出特定单词,成功提取出数兆字节的训练数据,包括大量PII。研究论文展示了该方法如何揭示模型训练数据的来源与隐私风险。

Google DeepMind

各个地区语言是怎么在网上「笑」的

本文关联的LinkedIn内容工厂报道中,虚拟助理借助人工智能工具批量生成高管帖文与互动评论,以维持其网络影响力。

Artificial Intelligence

ChatGPT 上线 1 年总结

ChatGPT成功的关键技术,通过真实人类对模型输出进行“好/坏”标注来优化回复质量,解决了单纯算法难以定义的任务表现问题,使对话体验大幅超越GPT-3。

RLHF

一些艺术家分享使用 AIGC 工具的工作流

文章中Stable Diffusion被Dom Harwood广泛用于音乐视频制作:通过DreamBooth训练Jessy Lanza模型、Warp Fusion处理视频动画,以及本地运行与社区工具扩展。相比Midjourney和Dall-E,其开源特性提供更大灵活性与控制力,但需结合光学流避免闪烁问题。

Stable Diffusion

一些艺术家分享使用 AIGC 工具的工作流

本文指出Stable Diffusion XL用于Dom生成高分辨率图像,作为Stable Diffusion的升级版本,能以更短描述输出更高质量结果。Dom在自定义模型后切换至XL,再用Photoshop进行16:9比例扩展,体现其在工作流程中的具体定位。

Stable Diffusion XL

一些艺术家分享使用 AIGC 工具的工作流

本文中ControlNet是Stable Diffusion的开源扩展工具,通过神经网络为图像生成添加额外条件约束。用户可根据需求设置参数,控制生成结果的具体特征。它被归类为Stable Diffusion Control Net,与其他工具共同构成Dom Harwood的工具链。

ControlNet

被 Google 收购的过程中学到了什么

本文将Google描述为收购Socratic的公司,拥有海量内部基础设施、monorepo和全球数据中心。收购后Socratic团队需按Google方式从零重建产品,同时作者分享了在大公司内推动项目需对齐多方目标、应对re-org和流程债务的经验。文章核心主题是“被Google收购后学到的经验”。

Google

一些艺术家分享使用 AIGC 工具的工作流

本文中AnimateDiff是AI视频生成器,能将文本到图像提示转化为动画序列。与Warp Fusion相比,它能完全消除闪烁,但对提示词的控制程度较低。Dom Harwood在动画阶段提及该工具,作为Stable Diffusion的补充选项,用于处理视频连贯性。

AnimateDiff

一些艺术家分享使用 AIGC 工具的工作流

Dom Harwood在Stable Diffusion中调用DreamBooth,以Jessy Lanza的新闻照片训练自定义模型,从而生成带艺术家特征的语境化图像,用于音乐视频的情绪板构建。该步骤让AI输出更贴合特定人物,而非泛化生成。

DreamBooth

JetBrains 的 AI 创作历程

本文介绍 Textual Inversion(p-tuning)通过冻结 UNet、VAE 和文本编码器权重,仅训练文本编码器中每个嵌入的新词(768 参数)。该方法支持最多 77 个可组合嵌入,训练约 2 小时即可在 RTX 4090 上完成。文章展示了使用“digital art in the style of ”提示词随训练步数增加逐步显现风格的过程。

Textual Inversion

JetBrains 的 AI 创作历程

文中CLIP指Stable Diffusion中的文本编码器(小型Transformer),负责将提示词编码为77×768的多模态嵌入向量。该嵌入与潜图像一起输入去噪UNet,引导生成过程。作者通过微调策略(如textual inversion)仅训练少量新词嵌入,保持CLIP主体权重冻结,以实现低数据、高效率的风格定制。

CLIP

JetBrains 的 AI 创作历程

Stable Diffusion 提供高保真图像,JetBrains 通过少量数据微调(textual inversion 或 LoRA)使其符合品牌色板、无伪影并支持抽象风格。它与 CPPN 管道结合,先用 CPPN 生成初始潜空间再经 UNet 去噪,以保留色彩与构图。

Stable Diffusion

Nightshade 数据投毒

LAION在文中被艺术家Autumn Beverly提及,她的作品曾被未经同意抓取进入该流行图像数据库,导致她一度撤下作品。Nightshade和Glaze等工具的出现让她重新获得信心在网上发布创作,凸显大型公开数据集在AI训练中引发的版权争议与艺术家反制需求。

LAION

JetBrains 的 AI 创作历程

本文中 Stable Diffusion XL 被用于生成符合品牌调色板的发布图形和桌面艺术。通过与 LoRA 结合微调,它能更好地捕捉复杂视觉模式,同时保持抽象平滑线条风格。文章指出 LoRA 在 SDXL 上效果最佳,可实现对设计师参考图的高效风格迁移。

Stable Diffusion XL

JetBrains 的 AI 创作历程

本文将 UNet 描述为 Stable Diffusion 的去噪核心组件,负责在潜在空间中逐步去除噪声。LoRA 方法通过在 UNet 注意力层插入适配器层进行微调,以捕捉设计师提供的特定风格。生成流程中,编码后的潜在图像与文本嵌入一同多次通过 UNet 完成去噪。

U-Net

JetBrains 的 AI 创作历程

本文中VAE指Stable Diffusion架构中的变分自编码器,用于将图像压缩到潜在空间以及从潜在空间解压回图像。在CPPN与Stable Diffusion的混合流程中,CPPN生成的灰度图经调色后通过VAE编码,与高斯噪声混合后作为UNet的初始潜表示,以保留品牌色彩与构图。

VAE

JetBrains 的 AI 创作历程

本文将 LoRA 描述为 Stable Diffusion 的高效微调方法,通过在 UNet 注意力层添加小型适配器层实现。相比 Textual Inversion,它能捕捉更复杂的模式,但多个 LoRA 无法组合使用。实验显示在 SDXL 上使用 LoRA 训练 200 至 1000 步即可获得理想风格效果。

LoRA

Nightshade 数据投毒

Stable Diffusion是研究团队重点测试的对象。实验表明,喂入50张投毒“狗”图像后,其生成的狗出现多肢或卡通脸;300张则可使狗被系统性地生成成猫。毒性还会扩散到“puppy”“wolf”等相关概念。

Stable Diffusion

靠卖域名为财政收入的那些国家

文章聚焦.ai域名因“AI”对应人工智能而成为AI初创公司的首选地址。安圭拉通过销售.ai域名每月获得约300万美元收入,约占政府月预算的三分之一,主要受益于人工智能浪潮。

Artificial Intelligence

字体设计模型训练

本文中 BigBird 被选作 Transformer 的稀疏注意力机制,支持全局注意力聚焦提示词,并通过窗口注意力观察前若干个字形,以在长序列下维持字体风格一致。作者在全注意力因序列过长而不可行后转向该方案,并要求其至少覆盖前三个字形。

BigBird

字体设计模型训练

本文参考SkexGen论文,对字形坐标嵌入分别使用独立的x和y可学习矩阵,以更好地表示路径点位置。该方法被应用于将token序列转换为最终的嵌入向量阶段。

SkexGen

字体设计模型训练

本文中BERT作为预训练编码器生成文本嵌入,用于捕捉字体描述提示的语义含义。输入序列限制为16个token,以适应单GPU内存限制。所有数据集中的字体描述均先被压缩为关键词后再输入BERT。

BERT

CSS 的 easy 主题模式切换

文中介绍作者 Bramus 目前担任 Google Chrome Developer Relations Engineer,负责前端技术推广与 CSS 新特性跟踪。

Google

字体设计模型训练

2023 年初作者入门生成式 AI 时主要使用的文生图工具,用于制作表情包并启发后续转向矢量生成的研究。

Stable Diffusion

字体设计模型训练

作者将代码从 Hugging Face transformers 迁移至 xFormers,显著提升了训练速度并降低了显存占用,成为单 GPU 长时训练的关键优化手段。

xFormers

字体设计模型训练

本文作者,从零学习构建生成式 Transformer 模型,开发出 FontoGen 项目,可根据文本描述输出 TrueType 字体文件。他在文章中详细记录了数据集构建、注意力选择与 127 小时单卡训练的全过程。

Sergey Tselovalnikov

字体设计模型训练

本文作者从零构建的生成式模型项目,输入字体描述文本即可输出包含大写字母、数字和标点的 TrueType 字体文件。模型采用序列到序列架构,在 71k 字体数据集上训练 50 个 epoch,最终实现根据关键词生成风格一致的整套字形。

FontoGen

字体设计模型训练

作者在 Stable Diffusion 实践中训练的低秩适配器,用于对朋友面孔进行个性化微调,作为学习生成模型的入门案例。

LoRA

字体设计模型训练

本文最初基于Hugging Face Transformers库构建自回归decoder-only Transformer模型,后迁移至xformers以提升训练速度和降低显存占用。最终模型包含16层、8个block,参数量达7370万。

Transformers

Rive CEO Guido Rosso 谈与 Flash 交集

Hugging Face 托管了 Stability AI 的 Stable Diffusion 空间,也是 GitHub、Civitai 并列的三大模型仓库之一。文中以此估算开源模型累计生成的图像数量超过百亿。

Hugging Face

Rive CEO Guido Rosso 谈与 Flash 交集

Stable Diffusion是Stability AI于2022年8月发布的开源模型,官方渠道累计生成6.9亿张图像。由于开源特性,基于其的各类平台与衍生模型总计生成125.9亿张,占同期全部AI图像的80%,成为最大贡献来源。

Stable Diffusion

用 Clojure 写的 AI 通关了 FC 上的超级马里奥

本文末尾的额外资源中列出DQN相关链接,指向一篇介绍从像素输入通过强化学习玩Atari游戏的文章。该方法与本文核心的优先级队列搜索加回溯算法不同,仅作为对比或延伸阅读出现。

DQN

Stratechery 社交产品地图更新

本文引用Instagram联合创始人Kevin Systrom的访谈,他回忆最初反对在Explore页面使用机器学习排序,认为其效果难以理解,后在数据证明质量大幅提升后转为支持。Systrom的经历被用来佐证算法排序在Instagram演进中的实际效果优于人工规则。

Kevin Systrom

用 Clojure 写的 AI 通关了 FC 上的超级马里奥

Agent57是DeepMind在Atari游戏上超越人类的强化学习系统,本文将其列为参考资源,暗示未来可结合类似方法改进当前基于搜索的马里奥AI。

Agent57

Stratechery 社交产品地图更新

本文引用Instagram联合创始人Mike Krieger的轶事,他在首次将机器学习应用于Explore实验时,因内部A/B测试结果超出正常范围而误报bug,最终确认算法效果远超预期。Krieger的经历与Systrom一同说明Instagram从时间线转向算法排序的决策依据。

Mike Krieger

Stable Diffusion 二维码

本文作者为倪豪,其在微信公众平台发布《ControlNet for QR Code》一文。文章主要内容围绕 ControlNet 与 QR Code 的结合展开,倪豪通过该文分享相关技术实现与观察结论。

倪豪

AI 正在杀死图库网站吗?

本文提到视频领域目前基本未受AI影响,因为text-to-video工具质量仍不足以商用。不过技术迭代速度很快,作者预计数月内就可能出现高质量AI生成视频。这与图片领域已开始大规模商业化形成对比,暗示视频创作者短期内压力较小。

Text-to-Video

Chrome 商店恶意插件越来越多

本文中Google作为Chrome Web Store运营方,被批评对恶意扩展审核与下架反应迟缓。尽管作者通过多渠道举报,多数扩展仍活跃两年以上。用户评价显示Google的“Report abuse”机制形同虚设。

Google

Stable Diffusion 二维码

本文标题为 ControlNet for QR Code,聚焦于将 ControlNet 技术应用于 QR Code 的生成场景。文章由倪豪撰写并发布于微信公众平台,核心探讨 ControlNet 在二维码相关图像任务中的具体用法与效果。

ControlNet

AI 正在杀死图库网站吗?

文中指出prompt engineering是与摄影相当的技能。许多买家因缺乏此能力,更倾向直接从Adobe Stock等平台购买现成AI图像,而非自行生成。

Prompt Engineering

AI 计算的成本

本文提到 NVIDIA 的 TensorRT 提供多项模型优化功能,能显著提升运行速度,但仅适用于 NVIDIA 硬件平台。

TensorRT

AI 计算的成本

本文指出当下主流生成式AI模型多采用Transformer架构,包括各类大语言模型。针对该架构,文章给出基于参数量p和token数n的粗略计算规则:推理约需2np次浮点运算,训练约需6p次每token,并讨论了内存占用及优化空间。这些估算直接服务于分析AI训练与推理的高昂算力成本。

Transformers

AI 计算的成本

文中将 SegMind 与 OctoML 并列,说明其为生成式模型提供专业优化服务,帮助创业公司应对高昂的 AI 算力开支。

SegMind

Google 正式推出 passkey

谷歌已开始在 Google 账户全面 rollout Passkeys 支持,覆盖所有主要平台,用户可通过 g.co/passkeys 快速设置。谷歌同时表示将与行业伙伴共同推动这一更安全便捷的登录方式落地。

Google

AI 计算的成本

文章指出Replicate作为图像生成托管平台,让开发者通过API快速迭代,无需承担底层硬件运维成本。

Replicate

AI 计算的成本

文章指出,OctoML 是专注于特定生成模型优化的第三方公司,许多初创团队会借助这类服务来降低推理和训练成本。

OctoML

一些应用的界面共情细节

文章开篇指出当前AI设计热潮下,人们反而更怀念具有人类情感的软件体验。强调在追求效率之外,需在界面中融入制作人的体贴与人性化元素,以平衡技术与人文。

Artificial Intelligence

AI 计算的成本

BERT被归类为当前主流的Transformer基大语言模型。文章未提供其参数规模或实测成本,仅通过列举说明Transformer架构已覆盖从BERT到GPT-3等多种模型,其通用计算规则与成本框架同样适用于BERT类模型。

BERT

AI 计算的成本

文章提到H100是前沿GPU,适合大型模型训练,但目前供应紧张,通常需一年以上长期承诺才能获得,性价比优于A100却难以获取。

NVIDIA H100

AI 计算的成本

文中将Hugging Face列为语言模型托管服务商,帮助初创公司快速验证产品市场匹配,无需自建基础设施或管理模型。

Hugging Face

AI 计算的成本

本文指出 Stable Diffusion 等开源模型显著降低了图像生成门槛,同时其所需显存远低于大型语言模型,可在消费级 GPU 上运行。

Stable Diffusion

Apple 辅助功能更新

设备端机器学习用于 Personal Voice 与放大器 Point and Speak 等功能,在本地处理语音创建与文本识别,既保护用户隐私,又实现 Personal Voice 与 Live Speech 的无缝集成及实体对象文字朗读。

设备端机器学习

AI 计算的成本

文中以A100为例说明其312 TFLOPS性能可将GPT-3推理缩短至约1秒,单次训练成本估算约56万美元,并作为当前主流训练硬件与多家云服务商定价对比基准。

NVIDIA A100

LLama 泄露引发的开源热潮

文章以Stable Diffusion为例,说明在文生图领域开源已成为基础模型的可行分发方式,与LLM领域的封闭API模式形成对比,凸显开源在不同模态中的不同影响。

Stable Diffusion

LLama 泄露引发的开源热潮

本文指出ColossalChat采用完整RLHF管道来实现ChatGPT式模型训练,这是其区别于其他Llama衍生项目的重要技术特点。

RLHF

LLama 泄露引发的开源热潮

文章指出 FedLab 是用于联邦学习模拟的框架,将在下一期 Edge 系列中与 Google 的相关研究一同介绍。

FedLab

BeReal 正在陨落

文中称Google广告收入下滑导致母公司Alphabet整体广告营收连续两季下降;此外Google旗下五家子公司被欧盟列入Digital Services Act监管对象,需于8月前满足审计与数据共享要求。

Google

LLama 泄露引发的开源热潮

文章指出SA-1B是Meta AI与Segment Anything Model一同发布的1亿掩码数据集,被称为有史以来最大的计算机视觉分割数据集。它作为SAM的配套资源开源,旨在推动图像分割研究。

SA-1B

非预测概念模型的短板

文中与 DALL-E 2、Midjourney 并列的图像生成黑箱模型。作者指出这类模型同样依赖自然语言提示,却难以让用户建立可预测的概念模型,导致社区出现大量提示工程研究、提示词市场和论坛。

Stable Diffusion

非预测概念模型的短板

本文提到Textual Inversion和DreamBooth方法通过少量示例图像微调扩散模型,让模型将特定物体与文本标记关联起来。用户可在新提示词中引用该标记,使生成图像包含对应物体,从而建立用户与模型间的共享 grounding。

Diffusion Model

WebGPU 进展

文中说明 TensorFlow.js 已针对 WebGPU 优化了大部分算子实现。作为机器学习框架,它借助 WebGPU 的并行计算能力,可将模型推理速度提升三倍以上,显著降低浏览器端训练与推理的延迟。

TensorFlow.js

畅想 iOS 融入 AI 后的未来

文中将当前AI发展描述为类似寒武纪爆炸的技术浪潮,已威胁Google搜索,未来将迫使智能手机操作系统改变。Apple被认为已意识到用户预期变化,需让Siri等功能变得更实用,以保持iOS竞争力。

Artificial Intelligence

非预测概念模型的短板

本文提及pix2pix方法,通过条件GAN将输入图像(如标签图或边缘图)转换为输出图像类型,利用空间约束降低自然语言的模糊性,为文本到图像模型提供更精确的控制。

pix2pix

LLama 泄露引发的开源热潮

本文在ML Research部分提及Google Research将超参数优化建模为贝叶斯优化问题,并提出Hyper BayesOpt算法。该方法无需为高斯过程量化模型参数,旨在简化优化流程。

贝叶斯优化

LLama 泄露引发的开源热潮

本文提到AI传奇人物Yann LeCun与Andrew Ng共同录制视频,表达对AI暂停开发提案的反对立场。该记录出现在AI Radar栏目中,与Llama开源创新主题形成呼应,体现行业领袖对AI监管的观点。

Yann LeCun

非预测概念模型的短板

本文描述Textual Inversion技术,用户提供少量示例图像后,模型可学习并关联特定文本标记与对象,在新提示中使用该标记即可生成对应内容,建立用户与AI的共享基础。

Textual Inversion

LLama 泄露引发的开源热潮

文章在“Next Week in The Sequence”部分预告下一期将继续系列报道联邦学习,涵盖跨设备联邦学习、Google 在联邦学习与差分隐私方面的研究,以及 FedLab 框架。

联邦学习

数字克隆

文章中作者以 chatglm-6b 为基础,使用微信聊天记录和博客问答数据进行微调训练。训练时设置较低学习率并增加 epoch,最终获得约 10 万条对话数据对应的模型。微调后的模型在聊天风格上更接近作者本人,成为数字克隆的核心步骤。

微调

非预测概念模型的短板

本文指出DreamBooth与Textual Inversion类似,通过少量示例图像微调扩散模型,将文本标记与特定对象绑定,用户可在提示中引用该标记以实现对象级共享语义。

DreamBooth

非预测概念模型的短板

本文指出神经符号方法可让生成式AI输出程序代码而非直接生成内容,代码可作为人类与AI共同理解的中间语言。开发者能检查代码是否正确,并在出错时用编程语言而非仅自然语言向AI提出修改建议。

Neurosymbolic AI

数字克隆

本文作者利用chatglm_finetuning项目提供的微调方案,对ChatGLM-6B模型进行训练,将微信聊天数据和博客问答数据分别用于参数更新与模型融合。

chatglm_finetuning

LLama 泄露引发的开源热潮

本文提到Meta AI发布Segment Anything Model(SAM),这是一种用于图像分割的大规模模型。该模型与SA-1B数据集一同开源,后者是迄今最大的计算机视觉分割数据集。SAM的发布被归类在ML Research板块,强调其在图像分割领域的应用潜力。

Segment Anything Model

LLama 泄露引发的开源热潮

文章提到 Google 在联邦学习与差分隐私方面的研究,将作为下一期 Edge 系列的内容之一。

Google

Intelligence Superabundance

本文将人工智能视为整体智能供给的增加,而非独立工具。作者认为其带来的效率提升将诱发更多需要智能的任务需求,而非简单替代人类工作,最终形成“智能过剩”。文章强调AI将让人类在相同时间内完成更多、更好的事情。

Artificial Intelligence

非预测概念模型的短板

本文提及DreamFusion作为生成式AI黑箱的例子,说明该模型可根据自然语言提示生成3D模型,强调这类工具能快速将提示转化为高质量输出,但用户难以预测其内部转换机制。

DreamFusion

LLama 泄露引发的开源热潮

Nebuly在文中开源了ChatLLama框架,该框架允许用户基于Llama利用自身数据构建个性化对话助手。它是Llama泄露后商业开源项目代表,聚焦于数据私有化和定制化场景,丰富了文章所述的开源LLM生态。

Nebuly

非预测概念模型的短板

本文将Arthub.ai列为提示词收集分享平台之一,说明在生成式AI黑箱难以预测输出时,用户通过这类网站交换提示以减少试错成本,体现了当前AI界面设计的不足与社区应对方式。

Arthub.ai

BeReal 正在陨落

本文在提及OpenAI的新闻时指出,采访讨论了该公司迈向AGI的路径,同时涉及安全与监管议题。此内容作为简短行业动态被收录于平台器新闻汇总中。

AGI

非预测概念模型的短板

本文说明pix2pix采用生成对抗网络(GAN),以输入图像类型为条件进行学习,实现从一种图像到另一种图像的翻译,从而为生成过程施加局部空间约束。

GAN

Twitter 开源了推荐算法,但

本文中Matrix Factorization是SimClusters嵌入空间的关键算法,用于发现以影响力用户为中心的145k个社区,每三周更新一次。用户和推文被表示为可属于多个社区的向量,通过社区内推文流行度完成嵌入。该方法支撑了Out-of-Network推荐的主要来源,帮助计算内容与用户兴趣的相似度。

Matrix Factorization

Modern iOS Navigation Patterns

本文未讨论人工智能相关技术或应用场景。

Artificial Intelligence

Twitter 开源了推荐算法,但

Twitter 推荐算法包含候选来源、排序、启发式过滤三个阶段,从数亿条推文中选出约 1500 条候选,再由神经网络打分排序。该算法每日运行约 50 亿次,平均耗时不到 1.5 秒,旨在优化点赞、转发等正向互动。

推荐算法

Twitter 开源了推荐算法,但

Real Graph是预测两个用户间互动概率的模型,用于In-Network来源的推文排序,分数越高则作者推文被纳入越多。它是In-Network候选源中最关键的组件,基于用户关注关系数据训练。

Real Graph

Twitter 开源了推荐算法,但

SimClusters是Twitter重要的Embedding Space之一,通过自定义矩阵分解发现145k个由影响力用户锚定的社区,每三周更新一次。用户和推文可属于多个社区,用于计算内容相似度,是Out-of-Network的主要来源。

SimClusters

Twitter 开源了推荐算法,但

本文中Neural Network是Ranking阶段的核心模型,参数规模约4800万,持续在推文互动数据上训练,用于预测用户对每条候选推文的多种正向互动概率。该模型接收数千特征,输出十个标签得分,不区分候选来源地对所有推文统一打分排序。它是决定最终时间线顺序的主要信号。

Neural Network

Twitter 开源了推荐算法,但

本文中Logistic Regression用于In-Network来源,对关注用户的推文进行相关性排序;同时也用于Out-of-Network来源中对图遍历产生的候选推文排序。该模型是In-Network来源的主要排序组件,但已多年未更新,目前Twitter正在重新设计训练。该模型帮助从海量候选中高效筛选出最相关的推文进入后续阶段。

Logistic Regression

Twitter 开源了推荐算法,但

Embedding Space通过数值向量表示用户兴趣与推文内容,计算相似度以判断相关性。本文中它是Out-of-Network推文的主要生成方式,规模超过社交图方法,SimClusters是其中典型应用。

Embedding Space

ChatGPT 原理

本文将激活函数描述为引入非线性的关键操作,通常采用Ramp(ReLU)等形式。作者指出正是这一非线性使神经网络能够拟合复杂函数,并在多层堆叠后实现对手写数字或文本模式的识别。

Activation Function

ChatGPT 原理

本文介绍Attention Mechanism是Transformer中核心组件,允许模型在生成每个token时对前面序列不同位置赋予不同权重。每个注意力头独立处理嵌入向量片段,实现对长距离语法与语义依赖的建模。文章给出GPT-2中注意力权重矩阵的可视化,显示其能“回看”早期token以决定后续输出。

Attention Mechanism

Musk 要求 Twitter 员工为他的推文增加曝光

文章提及Google在行业板块预览了Privacy Sandbox项目。该项目被定位为对Apple App Tracking Transparency的回应,旨在调整广告追踪机制。报道仅简要列出此预览,未提供更多技术细节或时间表。

Google

ChatGPT 原理

本文将Word2vec列为早期词嵌入方法之一,用于把单词映射为高维数值向量。作者说明这类嵌入通过大规模语料训练,使语义相近的词在向量空间中距离较近,为后续Transformer的输入表示奠定基础。

Word2vec

ChatGPT 原理

本文将深度学习描述为2012年前后突破的关键,指出当权重数量较多时,最小化损失的过程反而更容易进行。作者用此解释为什么大规模神经网络能有效建模语言,并将ChatGPT归为这一范式的实际应用。

Deep Learning

ChatGPT 原理

本文把损失函数定义为衡量神经网络输出与目标值之间距离的指标,用于指导权重更新。作者展示训练过程中损失函数随轮次逐步下降的曲线,并指出当其收敛到足够小值时训练被视为成功。

Loss Function

First 1000 - Waze

2012年已占据50%以上地图市场份额并推出Google Maps;2013年以11-13亿美元收购Waze,核心看重其由用户实时贡献的最优地图数据,而非自身算法。

Google

多邻国如何重塑增长

本文中,Duolingo Retention Team 在优化推送通知时,结合 A/B 测试与 bandit 算法,在不增加通知数量的前提下持续迭代文案、时机、图片等维度,累计产生数十个中小改进,显著提升 DAU 并保护通知渠道。

Bandit 算法

ChatGPT 原理

本文提及BERT作为词嵌入系统序列中的一员,与GloVe、GPT等共同基于不同神经网络方法构建。它将文本转化为高维向量,用于捕捉词语上下文含义,是大语言模型处理语义的基础组件之一。

BERT

ChatGPT 原理

本文指出Transformers是GPT系列模型采用的神经网络架构,包含多层注意力块与全连接层,能处理token序列并生成下一个token的概率。每个注意力块内有多个独立头,负责在序列不同位置间分配权重,实现对远距离依赖的捕捉。与传统全连接网络相比,Transformers更适合语言任务。文章展示其内部权重矩阵后认为,该架构虽复杂,但最终仅通过简单神经元运算完成语言生成。

Transformers

ChatGPT 原理

本文中Embedding是将词或token映射为高维数值向量的方法,使语义相近的词在向量空间中距离相近。ChatGPT先将输入token转为768维或更长向量,再叠加位置信息送入后续层。文章通过可视化示例说明Embedding能捕捉词义关系,是模型理解与生成语言的基础步骤。

Embedding

ChatGPT 原理

本文将GloVe列为过去十年开发的词嵌入系统之一,与word2vec、BERT、GPT等并列。它通过神经网络方法将单词转化为向量表示,捕捉语义近似关系,用于支撑ChatGPT等模型的文本生成与理解。

GloVe

ChatGPT 原理

本文将神经网络描述为由大量简单人工神经元组成的层状结构,每个神经元对输入加权求和后经激活函数输出。ChatGPT使用的网络含约1750亿权重,通过海量文本训练调整权重以最小化预测误差,从而学会生成类人文本。文章对比了小型网络与GPT-3的差异,指出网络规模与训练数据量大致相当是其成功关键。

Neural Network

Atomic Design 作者畅想设计系统的智能未来

文章探讨Artificial Intelligence作为设计系统消费者的应用场景:先训练其识别组件库,再通过自然语言提示快速搭建界面原型与组件。AI能处理机械性任务如生成变体与测试,但作者认为早期阶段仍需人工迭代与把关。AI也可能扩展至生成式UI设计,进一步降低门槛。

Artificial Intelligence

Artifact

人工智能是Artifact名称中“AI”部分的来源,指通过机器学习实现个性化新闻推荐的核心技术。文章指出Transformer等AI进展让文本社交成为可能,Systrom强调AI能理解用户兴趣并生成高质量推荐,同时Artifact会用AI过滤虚假信息并优先深度阅读内容。

Artificial Intelligence

Artifact

文章称 Google 于 2017 年发明 Transformer 架构,该技术显著提升语言理解效率,并间接促成 Artifact 等个性化新闻产品的诞生。

Google

Artifact

Machine Learning在本文中指Systrom从Instagram经验中认可的推荐系统技术,能快速优化用户体验并个性化内容推送。Artifact利用该技术理解用户兴趣,生成类似TikTok的文本推荐流;Systrom认为它是当前最酷的领域,Transformer模型的突破使其进步显著。

Machine Learning

Artifact

文章指出 Transformers 是 Google 于 2017 年发明的机制,能以更少输入理解语言,直接推动机器学习加速进步,并构成 ChatGPT 的核心组件。

Transformers

GitHub 裁员 10%,并决定完全远程办公

本文中人工智能是GitHub长期战略的核心方向。CEO Thomas Dohmke表示公司将聚焦AI以成为面向未来的开发者工程系统,并将GitHub Copilot视为最成功的AI产品,计划构建集成AI能力的GitHub平台。该方向与微软整体AI战略一致,旨在帮助客户提升生产力并加速云采用。 layoffs和远程办公调整正是为短期业务健康提供资源,支持AI长期投入。

Artificial Intelligence

DALL-E 原理解释(无数学版)

本文作者Jon Evans撰写系列文章,目标是向不熟悉微积分的普通读者解释AI工作原理。他以DALL-E为例,逐步拆解神经网络如何通过训练实现从文本提示生成图像,避免任何数学公式或术语,强调这一技术可能带来类似智能手机般的变革。

Jon Evans

DALL-E 原理解释(无数学版)

文章提到循环神经网络允许数据回环,但仍可有效建模为单向流动形式,常用于特定应用场景。

Recurrent Neural Network

Brave Search 加入隐私型广告

文章指出 Brave Search 广告与 Google 不同,点击体验完全私密,仅使用搜索词、国家和设备类型展示广告,不建立用户搜索画像或进行跟踪。

Google

DALL-E 原理解释(无数学版)

本文将梯度下降描述为神经网络训练的核心方法,通过损失函数计算当前输出与目标的差异,确定每个权重应调整的方向。文章用滑雪比喻说明这一过程:只能感知当前坡度,需多次小幅迭代逐步接近最优解,避免因调整过大而偏离或过小而效率低下。

Gradient Descent

画作鉴定 AI

本文聚焦AI用于艺术品真伪鉴定:Art Recognition用206幅Renoir真迹及同期同风格作品训练算法,将图像切分为小块后得出80.58%概率为真。后续经颜料分析确认,体现了AI与传统科学手段结合的鉴定流程,但专家仍强调需人工解读结果。

Art Authentication

画作鉴定 AI

瑞士公司Art Recognition开发了用于艺术品真伪鉴定的AI算法。本文报道其对私人藏家拥有的雷诺阿争议肖像画进行分析,得出80.58%为真迹的概率。此前该公司还曾判定苏黎世美术馆提香作品可能为赝品。

Art Recognition

Stack Overflow 禁止 ChatGPT 回答

本文中,NLP被提及作为理解语言模型的专业领域。作者指出,真正懂NLP的人不会认为此类模型适合生成正确代码,因为其训练目标是生成类似自然文本而非确保语义正确性。这与Stack Overflow禁止生成式AI内容的政策相关,强调模型的局限性。

NLP

Stack Overflow 禁止 ChatGPT 回答

本文提到Deepfake检测是研究热点,但AI生成文本的检测相对滞后。作者提出希望社区开发有效模型来识别ChatGPT生成内容,支持Stack Overflow的内容审核需求。这与禁止生成式AI答案的政策实施可行性相关。

Deepfake

日文网页的特殊风格

本文方法论部分使用 OpenCV 进行 t-SNE 可视化后的图像处理:通过 cv2.imread 读取截图、cv2.resize 统一尺寸,再用 cv2.imshow 在二维坐标上拼接展示网站聚类结果。

OpenCV

在 ChatGPT 中建立 Linux 虚拟机

虚拟机通过pip安装PyTorch 1.12.1,该版本实际于2022年8月发布,而ChatGPT训练数据仅到2021年9月,凸显其处于另类时间线。安装后可进一步检查版本与GPU支持(结果无GPU),证明模拟环境能完成深度学习框架的部署与查询。

PyTorch

Stack Overflow 禁止 ChatGPT 回答

本文将遗传规划作为专为生成代码而设计的AI系统示例,与ChatGPT等语言模型区分开来。作者建议若使用AI工具生成代码,应考虑此类针对性系统而非语言模型。这与讨论生成式AI在Stack Overflow上的适用性及限制直接相关。

遗传规划

DALL-E 原理解释(无数学版)

本文介绍反向传播是实现梯度下降的高效技术,先测量最终输出并调整最后一层权重,再逐层向前回溯调整前序层。每次训练迭代包含前向运行数据、测量输出,再反向逐层微调权重,使下次运行结果更优。

Backpropagation

DALL-E 原理解释(无数学版)

本文将跳跃连接比作楼梯侧面的水道,使部分数据跳过中间层直接传递至更后层,帮助网络更好地处理复杂信息。

Skip Connection

日文网页的特殊风格

文中采用预训练ResNet101模型提取网站首页截图的视觉特征,作为后续t-SNE降维和聚类分析的输入。该模型帮助量化不同国家网页设计的相似性,最终揭示日本设计的独特模式。

ResNet

在 ChatGPT 中建立 Linux 虚拟机

文章末尾将本文归类到机器学习标签下,内容聚焦 ChatGPT 这类大语言模型展现出的模拟 Linux 终端与运行程序的能力,属于机器学习应用场景的案例分享。

Machine Learning

DALL-E 原理解释(无数学版)

本文将 transformer 列为神经网络的一种类型,与长短期记忆、变分自编码器等并列。它同样遵循层间前向数据流动与反向传播调参的基本模式,却拥有独特应用方向。文章强调其具体实现细节对 DALL-E 等模型的运行有关键影响,计划在后续部分深入探讨。

Transformers

DALL-E 原理解释(无数学版)

文中将Machine Learning描述为现代AI的核心技术,其关键在于用大量神经元网络替代传统软件编程,通过反复调整权重来学习模式。作者指出这种方法能实现图像生成等复杂任务,但训练过程需要巨大算力和良好设计的损失函数。

Machine Learning

画作鉴定 AI

Carina Popovici是Art Recognition公司CEO,她在伦敦Art Loss Register会议上表示,AI能给出具体概率数值(如80.58%),避免主观“印象”判断带来的困扰。她强调公司仅用真实作品训练模型,并希望AI成为专家辅助工具而非取代者。

Carina Popovici

DALL-E 原理解释(无数学版)

文章指出从业者有时用感知机一词代替神经元,以强调其与真实大脑的区别,但全文仍主要使用神经元这一表述。

Perceptron

DALL-E 原理解释(无数学版)

本文指出学习率决定每次训练中权重调整的幅度,需凭经验设定。若过大可能越过最优值反复折返,过小则训练缓慢或陷入局部困境。文章强调它是平衡训练速度与稳定性的关键判断。

Learning Rate

DALL-E 原理解释(无数学版)

本文仅将其列为多种神经网络类型之一,指出这类网络各有特定应用场景,但整体仍遵循前文所述的层状结构与训练机制。

Convolutional Neural Network

DALL-E 原理解释(无数学版)

本文仅将其列为多种神经网络类型之一,指出这类网络各有特定应用场景,但整体仍遵循前文所述的层状结构与训练机制。

LSTM

日文网页的特殊风格

处理阶段用 PyTorch 加载 ImageFolderWithPaths 数据集,通过 torch.utils.data.DataLoader 以 batch_size=32 读取图片,并将 ResNet101 模型输出特征转为 numpy 数组保存。

PyTorch

画作鉴定 AI

本文中人工智能被瑞士公司Art Recognition用于分析有争议的《Portrait de femme (Gabrielle)》真伪。通过对206幅雷诺阿真迹照片及同期相似风格画作进行训练,算法给出该画作有80.58%概率为真迹的结论。文章强调其结果仅依赖训练数据集质量,无法完全取代传统鉴定。

Artificial Intelligence

DALL-E 原理解释(无数学版)

本文说明前馈神经网络的数据仅单向流动,从一层传至下一层,像水沿楼梯向下流动的比喻。多数实用网络属于此类,输入经层层处理后输出结果。

Feedforward Neural Network

DALL-E 原理解释(无数学版)

神经网络是本文解释AI的基础结构,由大量按层排列的神经元组成,每个神经元通过加权输入和输出函数处理数值。作者详细说明其训练过程包括梯度下降与反向传播,能让网络学会从噪声中重建或生成符合提示的图像,是DALL-E等AI应用的底层引擎。

Neural Network

Neal Stephenson 谈元宇宙

本期节目中人工智能被放在游戏与元宇宙交叉点上讨论。Neal Stephenson 阐述了 AI 如何参与元宇宙内容生成与交互设计。它被视为影响未来沉浸式体验与内容生产效率的重要技术变量。

Artificial Intelligence

DALL-E 原理解释(无数学版)

本文仅将其列为多种神经网络类型之一,指出这类网络各有特定应用场景,但整体仍遵循前文所述的层状结构与训练机制。

GAN

DALL-E 原理解释(无数学版)

本文将 variable autoencoder 列为神经网络的一种类型,与卷积、生成对抗等网络并列。它大致符合前文描述的层状结构与梯度下降训练流程,但具备自身特定应用场景。文章指出此类网络细节对理解 DALL-E 工作机制至关重要,预告将在续篇展开说明。

Variational Autoencoder

DALL-E 原理解释(无数学版)

文章解释损失函数用于量化网络当前输出与期望结果的差异,从而指导每次训练中对每个权重的调整方向,即梯度下降。该函数是训练过程的核心,决定如何逐步优化网络参数以接近目标。

Loss Function

DALL-E 原理解释(无数学版)

本文将人工神经元描述为类似小黑盒的结构,接收多个数字输入、各自带可调节权重,相加后通过输出函数曲线产生单个输出。它是构成神经网络的基本单元,虽松散模仿大脑神经元,但实际与大脑差异很大。文章强调大量此类简单神经元经精心连接和训练后,可实现强大功能。

Artificial Neuron

多邻国使用 Rive 的案例

本文中,Duolingo为每个世界角色开发独立语音时采用Text-to-Speech技术,但该方案无法提供发音细节与时间戳。为实现口型同步,他们结合自有语音生态系统,对生成的语音进行后续处理,以提取音素时序并映射到viseme动画状态。

Text-to-Speech

多邻国使用 Rive 的案例

文章提到,Duolingo利用内部Speech Recognition与发音模型,对Text-to-Speech生成的音频进行分析,获得每个单词与音素的精确时间信息。这些时序数据被映射到预设计的viseme嘴型上,从而驱动Rive状态机实现实时口型动画。

Speech Recognition

绕过新闻付费墙统计

本文中 Artificial Intelligence 指 Hearst 在编辑创新策略中的核心应用。该策略被定位为公司内容生产与业务发展的关键驱动,文章从分析角度探讨其在 Hearst 媒体运营中的实际落地方式与效果。

Artificial Intelligence

Chrome 移除 JPEG-XL 支持

本文讨论的文章标题显示,Google 正在解释为何决定从浏览器中移除 JPEG XL 支持。文章链接指向 Phoronix 论坛的相关讨论帖,焦点在于 Google 移除该格式的具体考量。

Google

Meta 苟延残喘

文中提到Google与Meta类似,未充分讨论ATT对其YouTube广告业务的影响,同时其资本支出也在上升。Google被视为除Meta外少数能承担大规模AI数据中心投资的公司之一。文章强调这种投资将深化Meta在数字广告中的护城河,Google是唯一可比对手。

Google

Meta 苟延残喘

文中指出,为构建概率模型应对ATT,Meta需采购大量NVIDIA A100等单卡数万美元的GPU服务器,用于广告转化预测和全网内容推荐。相比CPU为主的传统数据中心,AI训练硬件成本显著更高,但长期可形成竞争壁垒。

NVIDIA A100

AI 伦理讨论:mimic 与金政基事件

本文指出Stable Diffusion于8月22日发布,是开源AI绘画模型。用户可免费训练任意图像数据集,包括未经许可抓取的金政基作品,用于生成动漫风格图像,导致画师强烈反弹。

Stable Diffusion

图解 Stable Diffusion 的原理

本文明确指出 Stable Diffusion 使用 CLIPText 作为文本编码器,输入文本后输出 77 个 768 维 token 嵌入向量。该模型基于 GPT,参数量约 6300 万,早期的 Stable Diffusion 直接采用 OpenAI 发布的预训练版本。文章说明其嵌入结果会通过注意力层注入 UNet,从而实现文本对图像生成过程的条件控制。

CLIPText

图解 Stable Diffusion 的原理

本文指出Stable Diffusion的文本编码器采用Transformer语言模型(具体为CLIP的文本编码器),将输入提示词转换为77个768维的token embeddings向量,用于后续图像生成过程。

Transformers

图解 Stable Diffusion 的原理

文章提到 Stable Diffusion V2 改用 OpenCLIP 版本的 CLIP 模型,其参数规模可达 3.54 亿,远超原 ClipText 的 6300 万,有助于提升图像生成质量。

OpenCLIP

图解 Stable Diffusion 的原理

文章说明Stable Diffusion在压缩后的latent space而非像素空间执行扩散过程,通过autoencoder实现图像与latent表示的互相转换,从而显著提升生成速度。

Latent Space

图解 Stable Diffusion 的原理

文章描述 UNet 结构时指出,文本注意力层被插入 ResNet 模块之间,使后续 ResNet 块能够利用已融合的文本信息进行去噪。

ResNet

图解 Stable Diffusion 的原理

文章指出原始 Latent Diffusion 论文曾使用 BERT 作为文本编码器,而 Stable Diffusion 实际发布版则换成了基于 GPT 的 ClipText。

BERT

图解 Stable Diffusion 的原理

本文资源部分引用了两篇来自Hugging Face的博客,分别介绍Stable Diffusion与Diffusers的结合使用以及扩散模型的详细注解。这些链接为理解模型落地提供了官方示例与扩展阅读材料。

Hugging Face

图解 Stable Diffusion 的原理

本文作者 Jay Alammar 以可视化方式系统讲解 Stable Diffusion 的工作原理,文章标题为 The Illustrated Stable Diffusion。他通过图示拆解文本编码、图像信息生成器与解码器三大组件,重点展示扩散过程如何在潜在空间逐步去噪生成图像。文章还对比了不同语言模型对生成质量的影响,并提供了扩散模型训练与推理的直观流程。

Jay Alammar

图解 Stable Diffusion 的原理

本文核心主题 Stable Diffusion 是一个由多个神经网络组成的文本到图像生成系统,包含 CLIPText 文本编码器、UNet+Scheduler 以及 Autoencoder Decoder。它在潜在空间而非像素空间运行扩散过程,默认步数 50-100,能以较低资源生成高质量图像。文章详细说明其正向加噪训练与反向去噪生成流程,并指出其发布标志着高性能模型向大众开放。

Stable Diffusion

多元化和包容性背后的偏执

本文中 Google 被作者列为 Microsoft 在招聘时的主要竞争对手,尤其在吸引顶尖人才方面。作者指出,与 Google 的 Gmail 团队相比,Microsoft 的 Outlook 团队在薪酬、远程政策和声望上处于劣势,加剧了 D&I 政策下的招聘困难。

Google

图解 Stable Diffusion 的原理

本文指出 Stable Diffusion 使用的训练数据集为 LAION Aesthetics,该数据集包含大量美学质量较高的图像,使得模型生成的图片更倾向于具备美感。

LAION-Aesthetics

图解 Stable Diffusion 的原理

文章介绍 CLIP 作为 Stable Diffusion 的文本理解基础,由图像编码器和文本编码器组成,通过 4 亿张图文对以余弦相似度训练。CLIP 使模型能将文本语义转化为数值嵌入,进而指导图像生成。文章指出更大规模的 OpenCLIP 版本可进一步提升生成质量,并引用 Imagen 论文数据说明语言模型规模对图像效果的显著影响。

CLIP

图解 Stable Diffusion 的原理

文章介绍autoencoder负责将图像压缩至latent space(编码器)以及从latent表示解码生成最终像素图像(解码器),其尺寸从(4,64,64)映射到(3,512,512)。

Autoencoder

图解 Stable Diffusion 的原理

文中描述U-Net与scheduler共同构成图像信息创建器,在latent space逐步预测并去除噪声,生成符合文本条件的图像信息;其内部包含ResNet块与attention层以融入文本嵌入。

U-Net

图解 Stable Diffusion 的原理

本文在解释 CLIP 训练时指出,其正负样本对比机制与 word2vec 类似,需要同时学习匹配与不匹配的图文对以调整相似度分数。

Word2vec

图解 Stable Diffusion 的原理

本文说明 Stable Diffusion 正式发布的模型采用基于 GPT 的 ClipText 作为文本编码器,将输入提示转换为 77 个 768 维的 token 嵌入向量。

GPT

图解 Stable Diffusion 的原理

文章资源列表中列出Hugging Face博客文章《Stable Diffusion with 🧨 Diffusers》,指向使用Diffusers库运行Stable Diffusion的实践内容。它为读者提供了除理论之外的具体代码与工具实现路径。

Diffusers

谷歌关闭 Stadia 云游戏服务

本文所述谷歌公司于2022年9月29日上午9:15公开宣布Stadia关闭,同时参考其此前关闭Area 120部门时给予员工四个月内部转岗期限的做法,暗示Stadia剩余员工可能获类似安排。

Google

Platformer 第二年总结

Newton 在反思中指出,拜登时代新闻节奏放缓后,他将人工智能列为重点探索领域之一。他提到自己成为最早使用 DALL-E 为 newsletter 配图的作者之一,并在封面使用了该 AI 生成的蒸汽波风格插画。

Artificial Intelligence

Platformer 第二年总结

本文正文未涉及 Google,仅在文末“Read more”推荐的其他 Platformer 文章标题中出现,未提供具体内容或分析。

Google

YouTube 的「不感兴趣」没什么用

研究中使用了机器学习模型来判断YouTube推荐视频与用户已拒绝视频的相似度,作为评估bad recommendation的主要依据之一。该模型与人工标注结合,提升了定量实验的准确性,最终支持“用户控制基本无效”的核心结论。

Machine Learning

YouTube 的「不感兴趣」没什么用

本文聚焦YouTube推荐算法的实际可控性。实验表明,用户使用平台反馈工具后,算法仍会持续推送相似的不想要视频,时间跨度可达数月。研究量化显示最优控制方法仅能阻止43%的bad recommendation,证明算法对用户负反馈的响应权重过低。

YouTube推荐算法

Google 因误判 CSAM 冻结用户账户事件

本文讨论 Google 通过照片扫描系统对用户内容进行监控,报道了一张幼儿照片被错误标记的事件,引发外界对其数据处理方式的质疑。文章指出 Google 的系统在实际使用中可能对普通用户造成不必要的干预。

Google

Raycast Hacking Friday

Google 在文中被提及为类似 Rayday 活动的先行者,其内部 hacking 项目启发了 Raycast 将每周五作为创新时间。文章指出这种做法对产生创新想法至关重要,并已成为 Raycast 文化核心。

Google

Google Analytics 在部分欧盟国家被禁

文中 Google 被描述为美国电子通信服务提供商,其 Analytics 服务将欧盟网站数据传至美国,且需按美法律向情报机构披露数据,导致多国认定其使用违反 GDPR。

Google

Apple 发布多项创新辅助功能

机器学习性能被用于门检测功能,结合激光雷达扫描仪与摄像头,在设备端识别门的位置、开关状态及周围标志。该技术帮助失明或低视力用户顺利完成最后导航步骤,同时保障隐私。

Machine Learning

DuckDuckGo 搜索审查争议

本文中Google被提及为主动调整算法下调盗版网站排名,并曾在用户搜索海盗湾代理时推荐DuckDuckGo;近期也因ISP屏蔽令对部分盗版域名实施区域性下架,与DuckDuckGo本次全球性移除形成对比。

Google

下一代搜索引擎展望

本文将Google定位为当前主导的搜索服务,其他引擎常被视为其较差版本。它采用广告驱动模式,倾向于展示搜索结果页以获取广告收入,而非直接跳转目标页面。文章指出其结果缺乏个性化,且索引依赖大规模用户数据收集。

Google

Substack App 与其网络效应探讨

文中提到,Google与Facebook、Craigslist分走了大量广告收入,使传统媒体难以维持。Substack的创办者认为,这促使出版业需要转向读者直接付费的模式。

Google

ApeCoin:Yuga Labs 推出的新代币及其争议

文章报道Google Messages和Dialer应用涉嫌违反GDPR收集用户数据,同时Google正将量子计算部门Sandbox拆分为独立公司。Google回应称将对应用数据收集方式进行修改。

Google

Google 专家称 web3 不会杀死 SEO

文章指出谷歌81%收入依赖广告,并援引彭博社观点暗示Web3可能迫使谷歌调整商业模式。同时通过John Mueller的表态,谷歌官方立场是Web3不会杀死SEO。

Google

NFT在游戏和音乐领域的接受度差异

文中指出,美国参议院司法委员会批准法案,要求Google与Apple开放应用商店和支付系统。另有报道称,Alex Hanna从Google离职,加入前同事Timnit Gebru的新机构。

Google

GitHub Copilot 不仅能写代码

文章末尾“为你推荐”板块将本文归入MLOps Podcast系列,关联了多篇关于构建可扩展ML模型和LLM应用的播客与文章。

MLOps

Creativerly 运营者2021年最喜爱App盘点

文章指出人们常以“google”代指搜索互联网,但强调存在注重隐私的替代引擎。Google 被暗指为默认却缺乏隐私保护的主流工具。

Google

Baymard: DTC 网站用户评论的重要性与真实性

本文指出Google是DTC用户最常使用的外部信息来源。62%的测试用户表示会在购买前通过Google搜索第三方评论和品牌提及,29%的用户甚至在测试中直接离站搜索。用户用它来验证站内信息、查看社交媒体和新闻,以获取更可信的独立反馈,从而克服对DTC评论的强烈怀疑。

Google

2022年 Google 搜索结果页(SERP)质量评估

本文通过相关文章链接指出 Anthropic 借助 Surge AI 进行 RLHF 训练 Claude,强调人类反馈在提升模型质量中的作用,与搜索质量评估中的人工打分逻辑一致。

RLHF

Clubhouse 在南亚地区的活跃景象

本文页面底部推荐文章提及中美人工智能产业在研究网络与合作上紧密交织,尽管存在地缘政治紧张,但双方仍共享文化身份与技术联系。

Artificial Intelligence

2022年 Google 搜索结果页(SERP)质量评估

本文作者 Edwin Chen 曾任职于 YouTube、Twitter、Microsoft 的搜索测量团队,熟悉搜索质量评估方法。他通过 Surge AI 平台组织 250 名评测者,使用真实历史查询对 Google Search 进行 1-5 分评分及 Bing 并排对比,得出 Google 整体领先但存在明显缺陷的结论。

Edwin Chen

Google 抱怨 iMessage 对 Android 用户的区别对待

文章中Google通过Android官方推特账号及高管公开批评iMessage利用蓝色气泡制造同侪压力,称其锁定策略不正当,并推动行业采用RCS标准以改善跨平台短信体验。但文中指出Google自身过去15年间推出13款消息应用却反复放弃,缺乏长期策略,导致Android消息生态碎片化。

Google

GPT-3 的固有局限性

文章讨论GPT-3在人工智能领域引发的轰动,指出尽管其表现突出,但固有缺陷使其难以在短期内对就业市场或AGI目标产生决定性影响。

Artificial Intelligence

GPT-3 的固有局限性

文中认为GPT-3的发布让许多人误以为AGI即将到来,但作者明确表示当前版本GPT-3距离实现AGI还有本质差距,不会很快达成这一目标。

AGI

多邻国(Duolingo)S-1 上市招股书分析

Smart Tips是Duolingo的AI系统,能分类学习者常见错误,在练习出错后即时插入针对性语法解释。它避免让用户反复阅读表格,而是在最需要时提供规则,提升学习效率。该功能体现Duolingo通过机器学习优化课程效果的 backstage 策略。

Smart Tips

多邻国(Duolingo)S-1 上市招股书分析

BirdBrain是Duolingo开发的“学生模型”,每日评估每位学习者对每道练习的回答,预测其答对概率。系统据此自适应构建难度适中的课程,实现个性化学习体验。该模型是Duolingo实现“有效学习”核心技术之一,支撑其移动优先、数据驱动的产品策略。

BirdBrain

Google Gallery.io 即将关闭

本文由 Google 官方支持页面发布,说明 Gallery 产品下线时间表,并提供 gallery-support@google.com 作为用户咨询渠道,所有数据导出与删除操作均由 Google 执行。

Google

The Verge 总结 Epic 与 Apple 诉讼案百件内幕

文中谷歌被描述为计划构建跨平台游戏生态,包括将Android和Stadia游戏扩展至Mac和Windows,目标打造全球最大消费级游戏平台。Epic曾试图用《堡垒之夜》换取Google Play免费通道,谷歌Latitude也曾被苹果视为威胁。

Google

机器翻译的过去、现在和未来

早期机器翻译采用基于规则的方法,目标是让计算机掌握多语言词汇与语法实现自主翻译;1954年IBM 701用此方法翻译俄语化学句,1976年加拿大气象系统用于法英天气预报,但语法问题导致资金削减,后被统计方法取代。

基于规则的机器翻译

机器翻译的过去、现在和未来

本文指出图灵测试由阿兰·图灵提出,用于判定机器是否能表现出与人类相当的智能行为,核心任务是用自然语言与人交谈。作者强调至今仍无机器通过该测试,并以此说明当前机翻系统与真正智能的距离。

图灵测试

Hacker News 作为未来科技趋势预测指标的有效性分析

文章专节分析机器学习,指出该术语虽历史悠久,但当前 AI 浪潮始于 2010 年代初。Hacker News 仅领先主流趋势 6-12 个月,首次提及可追溯至 2007 年 2 月的评论区。

Machine Learning

Fredrick Brennan 谈 Twitter 新字体 Chirp

文章以Google的Product Sans为例,说明科技公司再设计时常采用全新几何字体,而非基于历史字体的做法。Chirp基于Franklin Gothic的复古风格与此形成对比,可能打破用户对屏幕字体的预期。

Google

机器翻译的过去、现在和未来

本文把N-gram定义为统计机器翻译中使用的2至3个单词的小词组。系统通过在平行语料中搜索这些词组的对应顺序来建立翻译规则,从而绕过语法指导,直接从数据中学习模式。

N-gram

机器翻译的过去、现在和未来

本文中统计机器翻译是谷歌翻译采用的方法,通过分析大量平行文本发现统计模式实现翻译,无需人工编写规则。系统将句子拆分为n-gram来提取对应关系,优点是自主学习,但作者批评它难以处理整体语义与文化语境。

统计机器翻译