Google Lens 详解:视觉发现的工作原理及如何准备

Google Lens 数据一览

视觉搜索从根本上改变了人们在线发现信息的方式,从基于文本的查询转向以摄像头为先的交互。谷歌的旗舰视觉搜索技术 Google Lens 现在每月驱动近 200 亿次视觉搜索,仅 2024 年通过 Lens 和 Circle to Search 进行的视觉搜索就超过 1000 亿次。本文将深入探讨 Lens 本身:其背后的识别技术、与 Circle to Search 的区别,以及实际需要做的准备工作。如需更全面的视角——通用图片 SEO、替代文本、结构化数据标记以及视觉搜索在 Pinterest、亚马逊和其他平台上的运作方式——请参阅我们的视觉搜索与 AI 图片优化完全指南。

Google Lens 界面展示了对植物、产品、地标和菜单等多种物体的 AI 识别效果,带有发光高亮

该平台的覆盖范围令人瞩目:每月有 15 亿人使用 Google Lens,其中 18-24 岁的年轻用户参与度最高。对品牌而言,尤为重要的是,这些视觉搜索中有五分之一——约 200 亿次搜索——具有直接的购物意图。这些并非出于好奇的随意搜索;而是潜在客户正在积极寻找购买他们在现实世界中看到的物品。这种富含意图的流量的转化率显著高于普通搜索流量。

Google Lens 的工作原理:视觉发现背后的技术

Google Lens 的核心是三种相互关联的 AI 技术协同工作,以理解和响应视觉查询。卷积神经网络(CNN) 是基础,通过分析像素模式来识别物体、场景和视觉关系,准确度惊人。这些深度学习模型在数十亿张标注图片上训练而成,能够识别从常见家居用品到稀有植物物种的一切事物。

光学字符识别(OCR) 负责文字检测和提取,使 Lens 能够读取菜单、标牌、文档和手写笔记。当您将摄像头对准外文菜单或路牌时,OCR 将视觉文字转换为可处理和翻译的数字数据。自然语言处理(NLP) 随后对文本进行上下文理解,不仅识别出哪些词语存在,还理解它们与您的查询之间的关联意义。

真正的力量来自多模态 AI——同时处理多种类型输入的能力。您现在可以将摄像头对准某个产品,用语音提问,然后收到结合了视觉理解和对话上下文的 AI 驱动回答。这种整合创造了一种自然直观的搜索体验。

功能传统文本搜索Google Lens
输入方式输入关键词图片、视频或语音
识别能力仅关键词物体、文字、上下文、关系
响应速度数秒即时
上下文理解仅限于查询文本全面的视觉上下文
实时能力是,支持实时摄像
视觉物品准确度低(难以描述)高(直接视觉匹配)
Logo

Ready to Monitor Your AI Visibility?

Track how AI chatbots mention your brand across ChatGPT, Perplexity, and other platforms.

Lens 和 Circle to Search 共享相同的底层 CNN、OCR 和 NLP 技术栈,但它们是两种不同的入口,操作成本也不同。Google Lens 需要打开应用(或搜索栏中的相机图标)并拍照或上传现有图片——这是一个有意识的主动操作。Circle to Search 是受支持的 Android 设备上的手势功能,允许用户圈选、点击或高亮屏幕上已有的任何内容——群聊中的照片、视频中的产品、Instagram 帖子中的穿搭——无需离开当前使用的应用。

对品牌而言,实际的差异在于发现发生的场景。Lens 捕捉的是物理世界中产生的意图(在商店或朋友家看到的产品)。Circle to Search 捕捉的是在其他应用和内容中产生的意图。这意味着相同的优化工作——清晰的产品角度、尺寸参照、描述性图像——会同时在两个渠道上产生效果,因为它们读取的是相同的视觉信号。

用户实际如何使用 Google Lens

Google Lens 的实际应用远远超出了好奇心的范畴。在购物中,用户拍摄在商店、社交媒体或视频中看到的产品,然后立即找到购买渠道并比较不同零售商的价格。顾客在朋友家看到一件家具,拍张照片,就能发现可购买的确切商品——一切都在当下完成,无需中断体验。

教育是另一个强大的应用场景,尤其是在发展中市场。学生拍摄英文课本中的问题或课堂材料,使用 Lens 将其翻译成母语,然后获取作业帮助和解释。这打破了语言障碍,让更多人能够获得教育资源。

旅行与探索利用 Lens 进行地标识别、餐厅探索和文化学习。游客拍摄不熟悉的建筑或标牌,立即获得历史背景信息。自然爱好者在户外活动中识别植物、动物和昆虫,将随意的观察转化为学习机会。

产品研究与比较变得无缝流畅。某人看到喜欢的包包,拍下照片,Lens 不仅返回确切产品,还返回附近零售商提供的不同价位的相似款式。这一功能从根本上改变了消费者从发现到购买的路径,也是 Lens 每年 200 亿次搜索带有直接购物意图的原因。

让您的产品图片为 Lens 做好准备

专门针对 Lens 的优化建立在通用图片 SEO 基础之上,同时增加了与其 CNN 推断尺寸、背景和实际使用场景方式相关的要求:

  • 提供多个角度和场景 - 从至少 3-4 个不同角度展示产品,既要有单独展示,也要有客户实际使用场景的真实环境
  • 包含已知尺寸参照物 - 将产品置于具有可识别尺寸的物体(床、门、人物、标准家具)旁边,以便 Lens 推断尺寸和比例
  • 创作生活场景摄影 - 展示产品在真实环境中与不同模特和使用场景的搭配,而非单调的影棚照
  • 保留季节性产品在线 - 不要从网站删除旧库存;相反,将商品标记为缺货并推荐类似的现有替代品

这四点是与 Lens 相关的额外要求。而基础的替代文本、文件名和产品结构化数据标记——这些让任何图片首先能够被 AI 系统发现的基本要素,与我们的完整图片优化指南中涵盖的内容相同——值得优先实施,因为 Lens 的识别仍然依赖元数据层和视觉信号的双重作用。

视频:Google Lens 最青睐的格式

静态图片是 Lens 优化的基本门槛;视频才是您的竞争优势。Google Lens 从视频帧中提取信息,意味着一个 30 秒的产品演示视频可以生成数十个静态图片无法实现的被发现瞬间。

视频能以图片无法实现的方式展示尺寸。当您展示一个床头柜放在大号床旁且旁边有人站立时,Lens 可以通过空间关系推断出精确的尺寸。当您展示产品实际使用场景时——防水包经受暴雨、站立式办公桌支撑双显示器、帐篷抵御大雨——您提供的证明超越了任何空洞的宣传。

转化率的影响是可衡量的。添加产品视频的电商网站转化率提升 20-40%,因为顾客在购买前可以直观地看到产品在自己空间中的效果。这些相同的视频也会在 Lens 搜索中被发现,从一个全新的渠道带来流量。

对比图:纯白背景下的静态产品照片 与 显示家具并带有尺寸参照和真实卧室环境的优化视频

技术要求很简单:15-45 秒的视频,从多个角度展示产品并带有清晰的尺寸背景,直接上传到您的网站(产品页面不要使用 YouTube 嵌入),使用描述性文件名和结构化数据标记。您不需要好莱坞级别的制作质量;展现真实背景的手机拍摄内容往往比单调的影棚视频效果更好,因为背景信息比制作价值更有意义。

您的 90 天 Google Lens 实施计划

实施 Lens 专项优化需要战略性的方法。首先在 Google Search Console 的图片部分审计您当前的视觉资产——大多数品牌发现自己获得了成千上万次展示但点击极少,这表明存在巨大的优化机会,而追逐基于文本的 AI 概览排名的竞争对手完全忽视了这一点。

找出按流量和收入排名前 50 的产品,然后对照上述清单评估其当前的视觉内容。哪些产品有多个角度?哪些有视频?哪些缺少生活场景摄影?这份实施计划周期为 60-90 天。第 1-2 周专注于规划和优先级排序。第 3-4 周进行内容创作——拍摄产品视频、生活场景摄影和制作演示内容。第 5-6 周进行技术优化:重命名文件、添加尺寸参照和上传内容。第 7-8 周专注于监测和迭代,跟踪哪些产品和内容类型带来了最多的 Lens 流量。

在 Google Search Console 的表现报告中筛选"图片"搜索类型来跟踪进展。预计需要 30-60 天才能看到显著的流量增长,因为谷歌需要时间重新抓取和索引您的新视觉内容。使用 UTM 参数或 Google Analytics 中的渠道分组,专门跟踪图片搜索流量的转化情况,以衡量投资回报率。

Google Lens 的未来发展

谷歌 Lens 的发展路线图正在向令人兴奋的方向持续扩展。Search Live(实时搜索) 将于 2025 年推出,支持与搜索进行实时对话——您可以将摄像头对准一幅画并问"这是什么风格?",然后追问"这种风格有哪些著名艺术家?",创造出无缝的对话式视觉搜索体验。

多模态 AI 能力持续进步,使 Lens 能够理解越来越复杂的视觉查询。Lens 不仅能识别物体,还能理解关系、背景以及关于您所看到内容的微妙问题。Circle to Search 的扩展将基于手势的视觉搜索带到更多设备和平台,使视觉发现变得更加便捷。

与谷歌生态系统的深度整合进一步放大了机会。Google Lens 现已内置于 Chrome 桌面版,意味着视觉搜索在灵感迸发的任何时刻都可使用。随着这些能力在全球范围内扩展到更多平台,早期优化的竞争优势将变得更加明显。

现在就开始准备的品牌——优化视觉内容、制作演示视频、确保尺寸参照正确——将随着这个渠道的持续爆发式增长而成为 Lens 优先呈现的对象。问题不在于 Google Lens 是否对您的业务重要;而在于当客户将摄像头对准您所销售的产品时,您是否能够被看见。

常见问题

Viktor Zeman 是 QualityUnit 的联合所有人。即便执掌公司 20 年,他至今仍主要是一名软件工程师,专注于人工智能、程序化 SEO 和后端开发。他参与过众多项目,包括 LiveAgent、PostAffiliatePro、FlowHunt、UrlsLab 等。

Viktor Zeman
Viktor Zeman
CEO, AI Engineer

监控您品牌的 AI 可见性

AmICited 跟踪 Google Lens、Circle to Search 及其他 AI 工具在视觉发现结果中如何引用您的品牌。获取 AI 可见性的洞察,优化您的视觉内容策略。

了解更多

视觉AI搜索
视觉AI搜索:基于AI的图像搜索技术

视觉AI搜索

了解什么是视觉AI搜索、其工作原理以及在电子商务和零售中的应用。探索基于图像搜索背后的技术,以及企业如何优化以应对视觉搜索。...

1 分钟阅读
视觉搜索与AI图像优化:完整元数据指南
视觉搜索与AI图像优化:完整元数据指南

视觉搜索与AI图像优化:完整元数据指南

这是一份完整的、平台无关的视觉搜索指南:AI系统如何通过嵌入向量解读图像,驱动可发现性的元数据和架构,以及适用于Pinterest、亚马逊、ASOS等平台的可持续优化工作流程。...

1 分钟阅读
Google AI模式:对搜索的影响及应对策略
Google AI模式:对搜索的影响及应对策略

Google AI模式:对搜索的影响及应对策略

了解谷歌AI模式如何改变搜索结果、影响网站流量,以及你需要做些什么以保持可见性。学习针对AI驱动搜索的优化策略。

1 分钟阅读