控油精華 60 天皮脂降 31%?少了對照組,這個數字只講了一半

2026 年 6 月一篇乳酸發酵物控油試驗,四項指標全面告捷。但它是單臂試驗——沒有對照組。而在同類外用抗痘研究裡,光是「賦形劑(無效乳霜)」平均就貢獻了 55% 的效果。這篇教你用四個問題,拆穿任何一張漂亮的成分數據圖。

保養教學
30 秒重點:一篇試驗說「用了 60 天,皮脂降 31.44%、毛孔縮 25.03%、含水度升 63.68%」。這些數字本身沒有造假,問題出在它們全部是「跟自己的 60 天前比」,而不是「跟擦了無效乳霜的另一群人比」。差別有多大?在苯甲醯過氧化物(BPO)的 12 篇對照試驗裡,真藥讓痘痘降 44.3%,而只擦賦形劑的對照組也降了 27.8%。少了對照組,你就無法知道 31.44% 裡面有多少是產品、有多少是「擦任何東西都會發生的事」。

一、先看這篇試驗到底做了什麼

2026 年 6 月發表於《Frontiers in Physiology》的這篇研究,測試一款含 3% 乳酸發酵物溶胞液(lactic acid ferment lysate,商品名 VHProbi® MixP)的乳霜。42 位油性肌受試者一天擦兩次,連續 60 天,在第 0、30、60 天用非侵入式儀器量測皮脂、卟啉、毛孔、經皮水分散失(TEWL)、含水度與膚質紋理。

量測指標第 60 天變化這個數字的性質
皮脂分泌量↓ 31.44%與自己的基期比,非與對照組比
卟啉(痤瘡桿菌代謝指標)↓ 44.60%與自己的基期比
毛孔外觀↓ 25.03%與自己的基期比
含水度↑ 63.68%與自己的基期比
膚質紋理↑ 38.43%與自己的基期比

研究者自己在論文中把它定位為 pilot trial(先導試驗),菌相分析部分也明確標示為 hypothesis-generating(僅供產生假說)。換句話說,作者本人並沒有宣稱這是定論——是行銷素材在轉述時,把「先導試驗的初步觀察」變成了「臨床實證有效」。

關鍵缺口:這是單臂試驗(single-arm)——所有 42 人都擦同一款產品,沒有任何人擦安慰劑乳霜,也沒有隨機分派。這代表試驗設計上,無法把「產品的作用」和以下三件事分開:①擦任何乳霜都會有的賦形劑效應 ②皮脂量測本身的生理性波動 ③統計上的均值回歸。

二、賦形劑效應有多大?平均 55%,最高逼近 90%

「賦形劑」就是把活性成分載進去的那個基質——乳霜、凝膠、乳液本身。直覺上它應該是「無效的對照」,但皮膚科試驗反覆證明:賦形劑自己就很有效。保濕、封閉、減少摩擦這些動作,本身就會改善膚況。

Chiou(2012)分析 8 種常用外用抗痘藥的對照試驗:藥物組平均讓總病灶數下降 42 ± 7.1%,賦形劑組下降 23 ± 5.0%;換算下來,賦形劑對「藥效」的平均貢獻度是 55 ± 15%(範圍 35–82%)。在 5 款苯甲醯過氧化物製劑中,這個貢獻度是 58 ± 31%,範圍最高來到 89%。原文結論直言:這個效應「in some cases this effect approached 90%」。

另一篇 2015 年的系統性回顧從 12 篇隨機賦形劑對照試驗、共 4,822 人的資料得到一致量級:

指標BPO 活性藥物組賦形劑對照組
總病灶數下降44.3%(SD 9.2)27.8%(SD 21.0)
非發炎性病灶下降41.5%(SD 9.4)27.0%(SD 20.9)
發炎性病灶下降52.1%(SD 10.4)34.7%(SD 22.7)
達到試驗成功標準比例28.6%(SD 17.3)15.2%(SD 9.5)

請注意一個容易被忽略的細節:賦形劑組的標準差(SD 21.0)比藥物組(SD 9.2)大一倍以上。這代表「不含活性成分的組別」表現極不穩定——有些試驗的賦形劑組幾乎沒反應,有些卻降了一半。這正是為什麼單臂試驗的單一數字不可靠:你抽到的可能剛好是賦形劑特別有效的那種情境。

三、安慰劑反應不是噪音,它可以被精確建模

2026 年 7 月一篇模型式統合分析納入 21,627 名受試者的痤瘡雙盲安慰劑對照試驗,量化出安慰劑組的標準反應曲線:

單看安慰劑組,12 週後:總病灶數減少 19.05 顆(95% CI: 16.54–21.52)、非發炎性病灶減少 10.71 顆、發炎性病灶減少 8.58 顆,治療成功率 11.83%(9.41%–14.35%)。這些全部發生在「完全沒有活性成分」的組別身上。

這篇研究最實用的地方在於,它示範了一個補救方法:作者用模型為兩篇單臂試驗「合成」出虛擬的安慰劑組(synthesize placebo arms for two single-arm studies),再回頭檢驗藥物是否真的優於安慰劑。這給了讀者一個可操作的判讀習慣——看到單臂試驗的數字時,先去找同類型有對照組的研究,看看對照組通常降多少,再心算扣掉。

該研究同時發現,安慰劑反應會受基期病灶數、女性比例、樣本數、劑型、是否搭配保養程序、研究經費來源、發表年份等因素影響。也就是說,安慰劑反應的大小本身是可以被試驗設計「調節」的。

四、皮脂儀的數字,本來就會自己晃

就算完全不擦任何東西,皮脂量測值也不是一個穩定的常數。2015 年一篇研究讓 40 位健康受試者相隔 7 天、在額頭量測兩次皮脂排出率(SER),結果發現:

研究者的結論寫得很直白:這些變異「could explain some of the inter-subject variability in SER measured between visits in clinical studies」——足以解釋臨床研究中不同訪視之間的皮脂量測差異。睡得晚一點、荷爾蒙週期到了不同階段,數字就會動。而這些跟你擦了什麼完全無關。

還有一個統計陷阱:均值回歸

均值回歸(Regression to the Mean, RTM)是指:當你刻意挑選極端值的受試者(例如「招募 42 位油性肌」=挑皮脂特別高的人),下一次量測時,這些數字會自然往群體平均靠攏,看起來像是「改善了」。Barnett 等人(2005)的方法學回顧指出,RTM「can make natural variation in repeated data look like real change」,而且量測誤差越大、以及當受試者是依基期數值篩選出來時,RTM 的影響越明顯——這兩個條件,油性肌控油試驗剛好全中。

五、誰出錢做的研究?

這不是誅心之論,而是有量化證據的現象。2005 年一篇分析四本頂尖皮膚科期刊、179 篇臨床試驗的研究發現:43% 的研究至少有一位作者揭露財務利益衝突,而這些研究「more likely to report a positive result」(更可能報告正面結果),同時方法學品質評分較高、樣本數也較大。

回到這篇乳酸發酵物研究,它的利益衝突聲明寫得很誠實,值得逐字讀:作者 HC(Cui H)與 ZD(Duan Z)受雇於 Qingdao Vland Biotech Group,作者 XX(Xu X)受雇於 Qingdao Yisu Biotech。也就是說,5 位作者中有 3 位任職於相關生技公司,而 Vland Biotech 正是 VHProbi® 這個商標的所屬企業。

怎麼看待這件事:利益衝突不等於研究造假,也不代表成分無效。它的正確用法是「調整你要求的證據強度」——當研究由成分商執行、且採用單臂設計時,你應該要求更多的獨立驗證,而不是把它當成定論。論文有誠實揭露,這是加分;問題出在轉述成廣告時,這段揭露永遠不會被印出來。

六、及格的設計長什麼樣子?一個正面對照

同樣是發酵成分研究,2022 年一篇《Journal of Microbiology》的研究示範了低成本也能做好的設計:20 位輕中度痤瘡患者,採隨機、安慰劑對照、split-face(同一張臉左右半邊分別擦產品與賦形劑乳液),為期 4 週。

結果:試驗側的醫師嚴重度評分顯著優於對照側(2 週 p = 0.009、6 週 p < 0.0005)。但同一篇研究也誠實報告:TEWL 與皮膚含水度在兩側之間沒有顯著差異("were not significantly different between the two groups")。

Split-face 設計的高明之處在於:同一個人的左右臉,共享同樣的睡眠、荷爾蒙、氣候、飲食——這些干擾因子全部被抵銷了。而它「有陰有陽」的結果(痘痘顯著改善、保濕沒有差異)反而是可信度的訊號。對照回頭看那篇單臂試驗「五項指標全部大幅改善」的完美結果,你就會明白為什麼滿分反而該讓人警覺。

七、把這篇試驗放進證據金字塔

不同的研究設計,能回答的問題強度差很多。下表把本文引用的每一篇研究,依設計排出高低,你可以直接拿這張表去對照任何一款產品所引用的「實證」:

證據等級研究設計能回答什麼本文對應文獻
最高系統性回顧 / 統合分析綜合多篇試驗,估計效果的穩定量級21,627 人安慰劑建模(41708067)、BPO 12 篇回顧(26048131)
隨機雙盲安慰劑對照試驗這個成分是否優於賦形劑Split-face 發酵物試驗(35286606)
非隨機對照 / 重測觀察相關性,以及量測本身的變異來源皮脂重測變異(25163854)
單臂試驗(本文主角)只能產生假說,無法排除賦形劑與均值回歸乳酸發酵物控油(42326996)
最低個人使用心得 / 前後對比照幾乎無法排除任何偏誤

值得注意的是,本文引用的兩篇「最高等級」文獻,講的都不是某個成分有效,而是「對照組自己也會改善多少」。這是實證保養裡最常被跳過、卻最關鍵的一課:知道「什麼都不做會怎樣」,才有辦法判斷「做了這件事值多少」。

為什麼賦形劑本身會有效?三個真實機轉

屏障封閉 乳霜基質減少經皮水分散失,屏障修復後,代償性出油與發紅本來就會下降。
行為改變 參加試驗的人會規律洗臉、按時擦保養、減少擠壓,這些行為本身就會改善膚況。
觀察與期待 受試者知道自己在被量測,回報與自評都會偏正向;這在無盲設計中無法被抵銷。

八、四個問題,拆穿任何一張成分數據圖

① 有對照組嗎? 「用後 vs 用前」是最弱的比較。要找「用產品組 vs 用賦形劑組」。沒有對照組,先預設效果要打對折。
② 有隨機分派嗎? 隨機化才能避免把「本來就會好轉的人」集中在某一組。Split-face 是小樣本的高效解法。
③ 誰出的錢? 看論文的 COI 聲明與作者任職單位。有利益衝突的研究更常報出正面結果(43% 揭露率)。
④ 結果太完美嗎? 所有指標全數告捷,比「有些顯著、有些不顯著」更可疑。誠實的研究通常有陰有陽。
實用心算法:看到單臂試驗宣稱「改善 X%」時,去查同類型有對照組的研究,看對照組平均降多少。以外用抗痘為例,賦形劑組大約貢獻總效果的 55%。把 X% 打個對折,才比較接近這個成分自己的貢獻。這不是精確計算,但比全盤照收準得多。

九、誠實標示:這篇文章查不到的東西

①「8 月到 10 月皮脂會自然下降幾 %」——查無可引用的量化數據。皮脂排出率受氣溫影響是學界共識(Piérard-Franchimont 等人 1990 年即記載 "ambient temperature influences the sebum excretion rate"),但我們沒有找到針對台灣或東亞族群、可直接引用的季節性百分比。因此本文不主張「這篇 60 天試驗的降幅來自季節轉換」,只主張「皮脂量測存在與產品無關的干擾因素(含但不限於季節)」。

② 乳酸發酵物外用控油,查無「有對照組」的直接對應研究。本文引用的 Enterococcus faecalis split-face 研究屬於不同菌屬的發酵產物,僅作為試驗設計的示範對照,不能用來推論「乳酸發酵物在有對照組時效果剩多少」。

③ 本文不主張這個成分無效。單臂試驗證據等級低,只代表「目前的證據不足以下結論」,不等於「已證實無效」。這兩者的差別很重要。

常見問題

Q1:所以這款產品是沒用的嗎?

不能這樣說。正確的結論是「證據等級不足以判定」。單臂試驗屬於證據金字塔偏低的層級,它適合當作「值得進一步做隨機對照試驗」的初步訊號——研究者自己也把它定位為 pilot trial。要下「有效」的結論,需要隨機、有對照組的試驗。

Q2:既然賦形劑本身就有 55% 的效果,那我直接擦單純的保濕乳霜就好?

對很多人來說,這個推論方向並沒有錯——保濕基質本身確實能改善屏障與觀感。但要注意兩件事:一是賦形劑組的效果變異極大(SD 21.0),代表不是每個人、每種基質都會有反應;二是「賦形劑貢獻 55%」意味著活性成分仍貢獻了另外 45%。這個數字是在告訴你「別為活性成分付出全部的溢價」,而不是「活性成分完全沒用」。

Q3:我自己用產品前後拍照對比,也算單臂試驗嗎?

是的,而且是樣本數 n=1 的版本,所有本文提到的偏誤都會作用在你身上:均值回歸(你通常在膚況最差時開始用新產品)、季節與作息波動、以及期待帶來的觀察偏誤。這不代表個人經驗無價值,但它不能拿來推論「這個成分對所有人有效」。

Q4:看到「臨床實證」四個字,是不是就代表有對照組?

不是。「臨床實證」「人體實驗證實」在化粧品行銷語境中並沒有法定的設計門檻,單臂 8 人的觀察也可以這樣寫。真正要看的關鍵字是 randomized(隨機)、vehicle-controlled 或 placebo-controlled(賦形劑/安慰劑對照)、double-blind(雙盲)、split-face(半臉對照)。這四個詞才是設計品質的實質保證。

Q5:為什麼「所有指標都改善」反而可疑?

因為真實的生理反應通常有取捨與雜訊。以本文引用的 split-face 研究為例,它報告痘痘嚴重度顯著改善,但 TEWL 與含水度沒有顯著差異——這種「部分顯著」的樣態,反而符合我們對真實效果的預期。當一份數據五項指標全部大幅告捷,較合理的解釋往往是設計缺少對照,讓賦形劑效應、均值回歸與期待效應全部被記在產品帳上。

科學參考資源

Song L, Cui H, Xu X, Duan Z, Meng G (2026). Evaluation of lactic acid ferment lysate for the management of oily skin: impact on sebum, hydration, and microbiota. Frontiers in Physiology. PMID: 42326996單臂先導試驗

Chiou WL (2012). Low intrinsic drug activity and dominant vehicle (placebo) effect in the topical treatment of acne vulgaris. International Journal of Clinical Pharmacology and Therapeutics. PMID: 22677304對照試驗分析

Luo J, Yu J, Cai Z (2026). Placebo response and its influencing factors in acne vulgaris: A model-based meta-analysis. British Journal of Clinical Pharmacology. PMID: 41708067統合分析|21,627 人

Lamel SA, Sivamani RK, Rahvar M (2015). Evaluating clinical trial design: systematic review of randomized vehicle-controlled trials for determining efficacy of benzoyl peroxide topical therapy for acne. Archives of Dermatological Research. PMID: 26048131系統性回顧

Bissonnette R, Risch JE, McElwee KJ (2015). Changes in serum free testosterone, sleep patterns, and 5-alpha-reductase type I activity influence changes in sebum excretion in female subjects. Skin Research and Technology. PMID: 25163854重測觀察研究

Perlis CS, Harwood M, Perlis RH (2005). Extent and impact of industry sponsorship conflicts of interest in dermatology research. Journal of the American Academy of Dermatology. PMID: 15928613文獻計量回顧

Barnett AG, van der Pols JC, Dobson AJ (2005). Regression to the mean: what it is and how to deal with it. International Journal of Epidemiology. PMID: 15333621統計方法學回顧

Han HS, Shin SH, Choi BY (2022). A split face study on the effect of an anti-acne product containing fermentation products of Enterococcus faecalis CBT SL-5 on skin microbiome modification and acne improvement. Journal of Microbiology. PMID: 35286606隨機對照|半臉試驗

Piérard-Franchimont C, Piérard GE, Kligman A (1990). Seasonal modulation of sebum excretion. Dermatologica. PMID: 2394299早期觀察研究