Gemini的新的AI Agent Gemini Spark 已经在台湾推出了 因此这次我将为大家介绍几个 我觉得非常实用的范例 不过还是要说一下 Gemini Spark的定位是什么呢 简单的说 它是一个给非工程师用的 用来处理工作上事物的AI Agent 在定位上与Claude Cowork Chat GPT Work 非常相似 你可以拿来处理试算表 整理公文 但有一个很大的不同点在于 它是在云端运行的Agent,不是在你的本机端。 因此它成了一个24小时联网的AI Agent。 就算你把电脑关上,它也能继续帮你工作。 你可以让它晚上帮你处理定期任务,早上起来验收。 接下来我们就从设定开始教你怎么使用Gemini Spark, 并且透过几个范例,教你怎么把这个24小时不休息的AI助手建立起来。 首先让我们打开Gemini, 目前这项功能对于Pro以上的付费账户开放。 不过就算是付费账号 它也是分批开放的 如果轮到你的话 看看左边的选单 你会在这里看到这个切换至 Spark的β次式版图示 点选进去就可以进入Spark 那么对于初次使用的人来说 现在会先有一个欢迎 以及隐私说明的视窗 你大致看一下 主要是跟你说明 它可以自动帮你执行任务 以及如果你使用到一些第三方服务 可能会有隐私资料共享的风险等等 看完后按下确认 就可以真正进入到Spark的页面 一开始先看一下这个界面 它这是与Gemini完全分离出来的界面 与Gemini原本的侧边栏完全不一样 这些工作栏上面显示的 也就是它目前可以进行的功能 我们把工作栏由上而下来看一下 最上面这个是工作 也就是你主要会用到的功能 切换到这里与它进行对话 交代任务 再来往下看 这个是排程 这里是显示一些已经安排好周期性的工作 接着再往下 这里则是技能 也就是你在上面打造的一些 你工作会用到的一些规则以及流程 最后是连接的应用程式 这是让它可以直接穿梭于各个App之间 代替你执行跨软体多步骤的复杂任务 不过这里目前连接的主要 还是以Google家族的服务为主 好 我们看到这里 在拿之前我们讲过的 ChatGPT网页版的Work界面来比较一下 其实两者之间 无论是界面 逻辑 以及用法 都是非常近似的 你可以把它直接看成是 Gemini 版的 Work 那你可能会问两者到底有什么不一样 关于这个问题我们先来实作几个范例等等再来讨论 首先一开始我们进来这个界面后 你可以看到在输入框下方这里 已经预设好几个可以协助你更快掌握它的用法的预设提示词 像是这里有个 Gemini Spark 设置这个项目用来协助新手快速进行一些基本设定 那我们就在这里点选下去 点选进去之后 在右边就会跟你开始对话 在这里说 可以透过你的一些Google连接的服务 让他学会了解你的角色 兴趣以及优先的事项 透过这些了解 他可以帮你预先建立好一些技能 以及工作任务 我们就试试看 他是不是真的这么有本事 到底可以对我有多了解 因此在下面回答好 接下来我们看他做了哪些动作 首先他看我的Google profile 其实我是第一次听到这个 查了资料后发现 这是我们对一些书籍、电影专辑的评论。 总之我从没用过这个功能。 再来它会启动Google Workspace Search, 这是搜寻我们的Gmail、云端硬碟、日历文件及日志等内容。 然后它去检视我们的Google形式力、Gmail等等。 总之就是透过各种Google服务的串接, 它尝试理解我们工作习惯以及属性。 到了最后进行总结, 它给了我们一个针对它对我们的了解进行的设定档。 我们来看一下这个内容, 这里包括名字 实用的语言居住在新北市都没有错误 再来他表示我的目标或是兴趣 是深层式AI工具 自动化工作流研究 以及科技影音内容计划与脚本撰写 然后我的角色是科技媒体资深编辑 以及内容创作者 这部分也很正确 然后在优先顺序这里 他列出的三点看来也很合理 然后最后这里显示的是 他建议这个助理与我在协同工作上的建议 他列出的是这两点 看起来也没有问题 那他問我要不要儲存我也回答好 那在儲存之後 他又問我是否要幫我安排一些排程的工作 那就讓他試試看好了 最終他幫我安排了兩個排程工作 第一個是在每周六上午9點 生成AI與科技趨勢周報 另一個是在每周二與周四中午12點 進行TK邦影音細化與內容進度追蹤 另外還有一個並沒有標示排程的項目 表示他就是一般的工作任務 好的 這就是透過他對我的了解 我们几乎没有输入任何内容 就帮我自动完成的设置 那么我们现在跳回主页面这里 刚刚他帮我们自动设定了一个 基本与他沟通的流程 以及设定的规则 另外又帮我们设定了两个工作排程 那么我们现在要去哪里 找到这两个建立的内容呢 先来看他设定的规则 我们点选左边的技能 这里在右边出来的技能页面这里 下方有一个使用中的列表 这里目前只使用一个技能 我们移到最右边 点选这三个点的设定 然后点选手动编辑 在跳出来的这个视窗这里 就可以看到 这是刚刚他帮我们写好的 基本工作设定的内容 决定了他与我们的对话方式 工作流程规则 偏好的语言等等 如果你需要微调的话 可以在这里调整 那么跳出来回到刚刚的画面 我们再来点选左边的排程 就可以看到在这个页面这里 就可以找到他刚刚帮我们 设定好的两个排程工作 那么我们到这里先暂停一下 目前为止我们看了一遍 Gemini Spark 基本的界面 以及透过对话的方式帮我们建立好了基本的设定档 以及简单的排程工作 再接下来我们要先跳出来讲另外两个功能 连接的应用程式以及技能 理解了这两个功能 你才知道 Gemini Spark 的能力范围 以及怎么指挥它做事 现在来说 Gemini Spark 利用了它与 Google 家族的生态优势 与其他的 Google 服务进行了整合 我们点选左边连接的应用程式这里 就可以在右边看到 你可以将Gemini Spark与Gmail Google文件 Google云端硬碟 以及Google Keep进行连减 目前来说你可以在这里读取这些服务中的内容 也可以把资料写入进去 等于说是让Spark的应用范围又扩张到更远了 不过同样的功能 Chat GPT Work其实也有 在那边叫做外挂程式 我们来看一下GPT Work的外挂程式有多少 你看这样一直往下拉 可以說是一眼望不完 而相較之下 Spark可以連接的應用程式不超過十個 真的是少得可憐 可想而知 可以應用的範圍要陽春得多 這點是Spark需要加強的地方 雖然說在下面這裡 他說他可以支援用mcp的方式 來連接到其他的第三方程式 但是他必須要用oOS的方式 因此可以使用的範圍又大幅縮小 目前也不值得去研究 還是等到Google未來改進再說吧 不管怎麼樣有了雲端硬碟的支援 Spark 可以應用的範圍還是大幅的擴張 你可以把雲端硬碟當成是你資料讀取的基地 或是把分析之後的結果放到雲端硬碟上 這樣就可以讓它進行更複雜的工作 舉例來說 我現在想要設計臉書社群的貼文以及貼圖 我输入的指令是这样 要它去网站上找最受欢迎的一则新闻 生成一份脸书贴文以及一份脸书贴图 重点是要把它储存在我们 Google Drive 的 叫做 Facebook 的资料夹 注意哦 其实现在我的 Google Drive 并没有这个叫Facebook的资料夹 因此他必须要自己先帮我建立这个资料夹 再把图片跟文字放到里面去 接下来就看他怎么样去分析我们的要求 然后开始一步一步去规划 建立要怎么执行我们的命令 基本上这个推理的过程是没有什么需要注意的地方 我们就快速跳过 直接来看结果 那么现在我们就等他跑完 最后他告诉我们完成了 我们先看这里 这是他选定的当天的T克邦的一则新闻 这的确是当天的没错 它在下面列出了这则新闻的几个重点 不过我们的命令 重点是要做成档案 储存在云端硬碟上 因此我们往下移动 看到在这边它有说明 已经在我们的Google Drive中 建立了叫做Facebook的资料夹 并且在这里依照了脸书贴文 以及脸书贴图附上了连接 那我们点选连接 它现在就打开我们的Google Drive 并且开启了这个叫做Facebook的资料夹 我们可以看到现在有一个脸书贴文的文字档案 以及脸书贴图的图片档案 不過我們打開來看一下所產生的文字以及圖片 發現它做出來的效果並不是很好 像是這個文字看起來比較像是新聞的語氣 內容太過於正式 不像是社群用的貼文那麼輕鬆 那另外再來打開這個圖片看看 也是做成像是科普類的圖片 一點也沒有社群那種輕鬆感 其實這也很正常 通常它給你的結果都沒辦法一次到位 因此我們回到Spark這裡 再輸入要求它改進 當然如果你能把改進的要求描述的越詳細 那它可以給你更好的結果 那如果還是不行 還有一個小技巧就是直接丟給他幾個範例 讓他參考修正 經過反覆幾次調整的動作 你可以看到我的雲端硬碟中的Facebook資料夾 多了很多圖片檔案 這就是我們反覆溝通修正的結果 當然多做幾次一定會更好 但我們現在就先假定已經完成了 那麼我們花了很長的一段時間得到這樣的結果 那么下次如果我们要再做一次类似的工作,比方说去其他的网站抓新闻,做脸书贴图的话,那这些试错的步骤难道要再来一次吗? 为了下次你不需要重复时间在同样的工作上,我们建议你,当你要他做完一件你的工作流程,并且对于结果调整到满意后,就把这整个流程做成Skill技能。 Skill就是把你的工作流程以及所需要的指令或是程式码都打包起来。 由於一般人很難可以憑本事從無到有獨立寫好 可以真正能上線工作的skill 因此建議你像我一樣 在剛剛驗證出一套實際可以完成工作的流程後 現在就在這裡輸入 把我的整個工作流程製作成技能 讓Spark協助你去做好一個技能 輸入好之後它會開始執行幫你打包 不過在這個過程中發生幾次小插曲 不知道是最近太多人使用 導致平台不大穩或是怎麼樣 總之我製作技能時,它卡在這個畫面10分鐘沒有任何反應 遇到這情況沒有關係,因為Spark它其實是在雲端跑的 我們這裡卡住不代表是真的卡住,因此我們可以跳出來更新一下 重新進入Spark,現在點選技能,這裡我們可以在上面看到 現在新增了一個名字以TechBankFB為開頭的技能 在這個選項點選進去可以看到它已經幫我們把整個技能架構完成了 那麼接下來要怎麼樣使用這個技能呢? 我們在輸入框這裡,輸入斜線就可以列出目前我們儲存下來的技能 那我們選擇剛剛這個TechBank FB的技能 然後輸入請他到國外網站上幫我們找出三則AI相關的科技新聞 然後製作成三則臉書的圖文 那麼現在他就開始執行了 或許你會問剛剛我們在製作技能的時候 明明內容是去TKBON網站上找一則新聞 然後製作成臉書的圖文 可是現在我們下的指令是去國外網站找三則新聞 做成三則臉書圖文 這樣不是跟原本的技能內容不一樣嗎? 在這裡說明一下 在Spark中 Scale並不是死板的規則 而比較像是一個參考的指南 Agent會依照你的指令去調整流程 嘗試理解 並且達到你想要的效果 以這個範例來說 它會將來源網站從Tickerbomb動態 抽換成國外網站 把產出數量從一則自動變成到三則 我們看看現在它給我們的結果 它在這裡給了我們三個 依照先前的模板产生的脸书贴图 然后在这个文件里头 包含了三则国外新闻的脸书贴文 我们切换到我们Facebook资料夹来看 这里就是生成出来的三则脸书贴图 明显看得出来 我们生涂的提示词写得好像还是太死了 导致这些脸书贴图除了文字外几乎没有变化 不过这事后可以再来持续调整 我们主要看的还是skill的原理以及应用 你可以依照个原理自己去变化 制作你自己的技能 现在我们再回过头来说排程 在 Gemini Spark 中 排程是让 AI 从被动问答变为主动工作的核心的功能 简单来说排程功能可以让 Spark 全天后 24 小时在云端自动运行 因为 Spark 基本就是一台 Google 云端的电脑 因此即使你把笔电关上 设定好的排程任务依然会在后台自动执行完毕 刚刚在一开始的范例中 它已经帮我们设计了两个排程工作 首先点选到排程这里 点选进来可以看到 下面在执行中这个标签的下方 显示了有三个任务 而上面这两个就是他刚刚帮我们设定好的排程任务 那其中第一个汇总每周生成是AI动态 下面有标示是每周六上午九点执行 那在下面有显示上次执行的时间是几个小时前 那在这个排程任务这里的最右边 点选最右边三个点 这里就可以进行排程任务的调整 我们点选手动编辑可以跳到这个编辑窗口 下方会显示出目前这个排程任务的提示词内容 我们看这个提示词 其实这内容本质上就还是一个技能 就是叫它帮我们汇总一周的AI资讯工作的资讯 整理成一个周报 基本上跟其他的技能没有两样 文中也没有说要怎么排程 它的排程主要是依靠这个界面上面的周期表来设定 你可以在这里进行调整 不过如果你想知道上次排程产生出来的任务结果 目前Gemini Spark的设计的非常不好 你必须要跳回到前一页 它在这里有一个前往对话串的选项 你点选下去之后 它也只是跳回到一开始的页面这里 然后你要自己在下面的对话串中 依照标题去对照哪一个对话串 是排成出来的结果 我们先点选进来 看看这里就列出了 它帮我们依照排成输出的结果 虽然这个结果还不错 但我们回头来看看这个对话串 是不是很混乱 从里头要找到特定的排成主题 还真的有点难度 也由于这个关系 所以建议你最好在指令中明确加入 要把成果存在云端资料夹中的特定位置 这样就不用来Spark里头大海捞针 另外要提的一点是 在Spark中除了依照时间去触发排程任务外 也可以依照事件来触发任务 去执行重复性的动作 比方说你可以要它检查Gmail中 收到特定主题的邮件后 自动进行后续的动作 或是检查云端资料夹中 新增了什么档案 去进行后续的动作 我们现在来举一个例子 假設我要針對我每次交易時發票來進行整理存檔 那我現在打開我手機版的 Gemini 切換到 Spark 然後在對話框這裡切換到相機 拍下一張發票的照片 我在手機上輸入 幫我把發票照片儲存在我的 Drive 中的發票資料夾 你看 雖然是在手機上 但是因為其實它與我的桌機版的 Spark 用的是同一個雲端的 Spark 因此在體驗上以及速度上其實是一樣的 那處理完之後它還給了我發票的明細資訊 那我在手機上要它以後只要收到發票的圖檔 都放到同樣的資料夾中讓它執行 我這樣在手機上反覆上傳了四張發票的照片 不過呢,手機版的Spark還是陽春了一點 在介面上我們看不到排程 连接应用程式那些侧边栏的内容 也无法进一步设定 因此现在我们切换回桌机版的Spar 我们在排程这里 可以看到新增加了一个叫做 自动处理与硅档电子发票的排程 我们点选进来看内容 它上面的触发条件 目前写的是收到电子邮件时 主题或是附件中有发票相关的内容 才会帮我们触发这个任务 这个触发条件是我们先前另外追加的要求 没有在前面的示范中演示出来 那现在我们可以修改这个任务的内容 比方说希望我们的发票除了有单独的资讯外 还可以有一个统一汇总的表格 方便我整理 我们现在回到上一页 在设定这里选择使用Gemini编辑 那么实际上它的动作是跳回到 我们先前在手机上的对话串里头 我们现在在对话串中追加一些新的任务 表示我要把发票的内容整理到一个试算表中 可以统一看到我在哪里花了多少钱 以进行分析 那么他在这里处理了一下之后 回答我们他已经在原本的发票资料夹中 新增了一个发票消费记账表 好,我们现在到我的云端硬碟中 打开这个发票资料夹来看一下 在这个资料夹中有几张是上传发票的文字内容 你可以看到 在最下面有一个叫做发票消费记账表的试算表 打开之后可以看到他已经依照日期 消费地点、商家、金额等等的资讯 帮我们记录起来了 这就是你可以利用触发事件的功能 来建立的排程任务 你也可以想想有哪些周期性 固定性的工作任务 可以分配给它处理 最后我们来简单分析一下 虽然 Gemini Spark 与 ChatGPT Work 乍看之下很相似 但是其实有很大的差异 首先 Spark 目前只能串接 Google自家的生态系 在能力上受限很多 完全不及 ChatGPT Work 的多样化 此外 Spark 只能处理网络上的内容 无法处理你本极端的档案 因此目前的Spark 比较像是常住在你背景的助理 还无法像ChatGPT Work那样全面 不过如果你是高度依赖Google服务的重度使用者 Spark也的确能帮你处理很多工作中的琐事 再来因为Gemini Spark在背景 帮你处理各种自动化任务时 底层调用的依然是Gemini模型 所以它消耗的总算力 基本上是跟你的Gemini App 共用同一个额度池 所以如果你的任务很复杂的话 可能要随时再设定检查一下你的用量 好啦,这就是今天 Gemini Spark整个教学的内容 有什么问题,欢迎在留言告诉我 也请帮我按赞分享,开启小铃铛 今天的教学就到这里 我们下支影片再见 拜拜