同一段時間序列,先畫成折線圖再交給 VLM,確實可能比直接貼整串數字省 token 與 GPU 能耗。 2026 年 8 月公開的一篇 ECRES 2026 論文,把 8 個電信 KPI、381 個時間點分別轉成逗號分隔數值與 2D 圖,圖像輸入在三種模型上少了 3.6–10.4 倍 token,單次推論能耗少 1.8–2.5 倍。
這不代表 Excel、CSV 以後都該截圖上傳。研究任務是找時間序列異常,圖形很適合保留峰值、漂移和震盪形狀;若你要算精確營收、判斷是否超過法定門檻、預測下月需求或留下可稽核結果,原始數值仍是主體。對維運、製造、能源與產品分析團隊,最值得測的是「VLM 先圈異常區間,程式再回查數值」的兩段式流程。
研究怎麼比較數字與圖像?
研究測試 Llama-3.2-90B-Vision、Qwen2.5-VL-72B 與 Pixtral-12B。文字路線把每個時間點的浮點數寫成逗號分隔資料,圖像路線則把同一批序列畫成上下對齊的折線圖,再交給各模型的 vision encoder。兩條路線使用相同資料,才能把差異集中在輸入表示法。
公開資料部分使用 realAWSCloudwatch 子集;電信資料來自一個 4G/5G 網路,涵蓋 209 個基地台 cell、9 個日期與 24 個 KPI。團隊用 5 天訓練、4 天測試,主要比較取其中 8 個 KPI,每 15 分鐘一筆。圖表刻意移除座標標籤、刻度與格線,讓模型讀形狀,避免文字資訊混進視覺 token。
能耗透過 NVIDIA NVML 硬體計數器量測 GPU,測試使用 A100 與 A6000,輸出固定為 256 token。這是 GPU 推論能耗,不包含 CPU 前處理、把數字繪成圖的成本、記憶體與網路、整台伺服器、冷卻或資料中心 PUE,因此不能直接改寫成完整碳排。
若要自行部署重現,三款模型的參數量、顯存需求與授權條款並不相同;可下載權重也不等於任何用途都能直接商用。採用前要逐一核對官方模型卡與最新授權,並在自己的硬體上重測。論文中的跨模型倍率適合比較輸入表示法,不能當成三款模型的採購排名。
3.6–10.4 倍與 1.8–2.5 倍怎麼看?
| 模型 | 數字文字 token | 圖像 token | 輸入縮減 | 電信測試 GPU 能耗縮減 |
|---|---|---|---|---|
| Llama-3.2-90B-Vision | 46,101 | 6,404 | 7.2 倍 | 2.5 倍 |
| Qwen2.5-VL-72B | 56,372 | 5,442 | 10.4 倍 | 1.8 倍 |
| Pixtral-12B | 59,803 | 16,800 | 3.6 倍 | 2.5 倍 |
token 降幅沒有等比例變成能耗降幅,因為 vision encoder 本身有固定成本,模型還要產生相同長度的輸出。不同視覺編碼方式也差很多:Llama 使用固定視覺 token 預算,Qwen 會按解析度切片,Pixtral 保留較多空間細節。看到「看圖省十倍」時,先問是哪個模型、圖片尺寸與 tokenizer。
準確度也有改善。電信資料上的 Llama 文字路線 F1 是 0.185,零樣本 VLM 為 0.360,微調後為 0.464。論文所稱 precision 提高 220.7%,是從 0.145 增加到 0.465 的相對幅度;precision 仍未超過一半,不能理解成 220.7% 準確率。
另一個實用結果是解析度。Qwen 的圖從 150 DPI 降到 75 DPI,視覺 token 從 17,303 降到 5,112,GPU 能耗下降 24%,F1 在該測試裡從 0.347 變成 0.354。這只表示尖峰、隆起和週期變化在該資料仍看得見,細微幅度、短暫事件或密集曲線不一定能承受相同壓縮。
研究有一個會影響上線決策的缺口:電信評估只挑原本就有 ground-truth anomaly 的日期,理由是避免被無異常日懲罰。正式監控每天都會遇到正常資料;沒有把正常日納入,就無法完整估算每千次查詢會跳出多少誤報。異常標籤又來自另一套 causal anomaly detection 系統,仍可能繼承上游標記誤差。NIST 的 AI 評測指南也提醒,固定 benchmark 的分數不能直接當成所有未來資料的泛化表現。
什麼情況適合看圖,什麼情況要保留數字?
找尖峰、漂移、缺口或週期破壞: 把資料畫成固定格式的折線圖,再讓 VLM 圈出候選區間。這類任務重視形狀,圖像壓縮較有機會發揮。
判斷是否超過精確門檻: 保留原始數值並交給程式判斷。圖像會失去小數、單位與邊界精度,0.01 的差距也可能左右結果。
計算加總、平均、百分比或財務數字: 使用 CSV 搭配 Python、R 或試算表,讓公式與結果可以重跑。不能讓模型從像素估值後直接寫入報表。
預測未來需求或容量: 優先比較 TimesFM、ARIMA 等專用時間序列模型。它們直接處理時間依賴與預測區間,VLM 圖像判讀可作為補充訊號。
大量監控的第一輪篩選: 先用 VLM 找候選區間,再以數值規則複核。這種分工能利用視覺壓縮,同時保留告警的可稽核依據。
圖像路線也需要一致的產圖規則。Y 軸若每張自動縮放,同樣大小的變化可能被畫成完全不同的坡度;不同 KPI 疊在同一張圖,量綱與尺度也會互相掩蓋。正式測試要固定時間窗、解析度、線寬、色彩、subplot 順序與縮放方式,並保存產圖程式版本。
若你手上只有一份 Excel 或 CSV,先用 AI 資料分析 30 分鐘驗證流程檢查欄位、缺漏與計算口徑。要理解 precision、recall、F1 與訓練測試切分,可先補 機器學習與模型評估入門。時間序列圖像化解決的是輸入表示,無法替代資料品質與評估設計。
用 7 天做一次自己的 CSV 對圖片測試
- 第 1 天,定義告警成本。 先寫下漏報一次與誤報一次各要付出什麼代價,再決定主要指標看 precision、recall、F1、延遲或每次能耗。
- 第 2 天,建立時間切分。 訓練、調參與測試按日期分開;測試集同時保留正常日、明顯異常與難判定案例,避免只挑有事件的資料。
- 第 3 天,做三條 baseline。 同一批資料分別跑數字文字輸入、固定格式圖片輸入,以及一個 ARIMA、Isolation Forest、TimesFM 或既有監控規則。
- 第 4 天,固定執行條件。 使用同一張 GPU、量化設定、輸出長度、warm-up 次數和 batch size;分別記錄 input token、延遲、峰值記憶體與 GPU 能耗。
- 第 5 天,核對正常日。 除了 F1,計算每 1,000 個正常視窗的誤報數,並查看異常區間起訖是否偏移。只報平均分數會藏掉值班人員最痛的告警疲勞。
- 第 6 天,做壓縮測試。 比較解析度、時間窗、KPI 數量與 Y 軸縮放;任一改動都要重新測精度,不能直接沿用論文的 75 DPI。
- 第 7 天,決定路由。 VLM 若省資源且召回高,就讓它負責候選區間;精確門檻、根因與告警則交給數值程式和人工覆核。
NVML 可以讀取 GPU 自驅動載入以來的累積能耗,適合同一台機器做前後差分;它不會自動涵蓋整機用電。若團隊在本機測模型,也要同步記錄顯存、量化與 context 條件,可參考 Windows GPU 跑本機模型的驗證方式。更大的電網與資料中心背景則整理在 AI 資料中心電力壓力。
這篇研究已獲 ECRES 2026 接受,比純預印本多一層會議審查;公開頁面仍沒有附上可重現電信實驗的程式與資料連結。它只測三種 VLM、單一電信業者、單 GPU 與 256-token 短輸出。較長診斷報告會讓輸出成本占比升高,多 GPU、CPU 繪圖與正式 serving 也可能改變倍率。結論可拿來設計試驗,不能直接拿來寫採購節省承諾。
常見問題
時間序列資料傳圖片一定比 CSV 好嗎?
不一定。找形狀、尖峰與異常區間時,圖片可能更省 token;精確計算、門檻判斷、預測與稽核仍應保留 CSV 和可重跑程式。先用自己的資料比較,不要直接套用論文倍率。
研究中的 3.6–10.4 倍是省了多少費用?
這是輸入 token 數量縮減,沒有直接對應固定 API 費用。不同服務對圖片、視覺 token、快取與輸出 token 的計價不同;自架模型還要看 GPU 時間、吞吐、整機用電與維運成本。
為什麼 token 少十倍,能耗只少 1.8–2.5 倍?
視覺編碼器需要固定運算,模型也要產生相同的 256 個輸出 token。輸入縮短主要降低 prefill 成本,無法消除視覺前處理和輸出生成,因此能耗不會和 token 等比例下降。
可以把股票 K 線圖交給 VLM 做交易嗎?
不建議只靠圖像判斷交易。價格圖可能幫忙標記形狀,仍缺少成交量口徑、公司事件、交易成本與未來資訊隔離。任何回測都要保留原始數值、時間切分和樣本外驗證,不能把這篇電信異常研究外推成投資績效。
VLM 找到異常後,下一步怎麼驗證?
把模型圈出的起訖時間回查原始資料,重算門檻、變化率與相關 KPI,再用既有監控規則或專用模型複核。正式告警要保存原始值、圖像版本、模型版本、輸出與人工處理結果。
參考來源
- arXiv:A Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving Accuracy(2026-08-07)
- arXiv:Harnessing Vision-Language Models for Time Series Anomaly Detection(2025-06-07)
- NVIDIA:NVML API Reference Guide - Total Energy Consumption(2026-08-11 查閱)
- NIST:Expanding the AI Evaluation Toolbox with Statistical Models(2026-02-17)
- Google Research GitHub:TimesFM - Time Series Foundation Model(2026-08-11 查閱)