Gemini for macOS 推出了一項針對語音互動的重大更新,其核心目標在於減少使用者在不同應用程式之間切換的摩擦力,讓 AI 能夠直接在使用者目前工作的視窗中進行操作,維持所謂的 Flow 狀態,也就是讓開發者或創作者能專注於當前任務而不需要頻繁切換視窗。
這次更新最直觀的改變是引入了快捷鍵觸發的語音輸入機制。使用者只要長按 Fn 鍵,就可以直接對著電腦說話。這在技術實務上分為兩個層次:智能聽寫與上下文推理。
首先是智能聽寫 Intelligent Dictation。傳統的語音轉文字工具往往會將所有的口語贅字,例如嗯、啊等填充詞,全部原樣轉錄,導致後續需要大量的手動刪除。Gemini 的智能聽寫則是在轉錄過程中自動過濾這些贅字,並能辨識出使用者在說話中途的自我修正,直接輸出精簡且格式正確的文字到游標所在的位置。對於需要快速紀錄想法或撰寫初步草稿的工程師來說,這大大降低了從口頭構思到文字落地的成本。
其次是更進階的上下文推理 Gemini Reasoning。這是一個關鍵的功能跨越,因為它讓 AI 不再只是單純的文字輸入法,而是能理解目前螢幕上顯示的內容。當使用者在設定中開啟此功能後,Gemini 可以將螢幕上的本地檔案、圖片或選取的文字作為輸入上下文。
在實際應用場景中,這種能力體現為三種核心操作。第一是資訊提取與摘要,使用者可以選取多份本地文件,直接下令讓 AI 讀取這些資料並將摘要寫入另一封郵件中。第二是即時文本重寫,透過選取螢幕上的文字並使用語音指令,可以快速調整語氣或將雜亂的筆記轉換為具有 TL;DR 摘要的執行摘要。第三則是影像的迭代生成,使用者可以參考桌面上的既有圖片,透過語音要求 AI 生成對比版本,例如將現有的插圖轉換為深色模式。
從工程實務角度來看,這項功能的意義在於將 AI 的觸發點從單一的對話視窗,擴展到了整個作業系統的 UI 層級。對於使用者而言,這意味著 AI 變成了一個能夠感知環境的助手,而非一個需要手動複製貼上資料的外部工具。
目前這項功能優先在 macOS 版本的 Gemini 應用程式中提供英文支援,並計畫逐步擴展至更多語言。對於習慣使用 macOS 生態系且需要處理大量文本與跨文件整合工作的專業人士來說,這將顯著提升處理複雜任務的速度。
來源:blog.google
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。