PROJECTS / 做過的事

從問題開始,
做到實際交付。

工作、研究與個人實作。查看完整履歷 ↗

Wafer Map / 回到數值本身

自動攔檢需要同時考慮該攔下的異常,以及不應誤攔的正常情況。我的工作從量測資料的表示方式開始。

約 99% · NT$ 3 億

Wafer Map:判讀方法與專案成果
Wafer Map:判讀方法與專案成果

判讀表現約 99%,涵蓋應攔與應放行的情況;3 億元為產線工程師立案時預估的專案效益。

重新檢查影像表示

原始資料是數值型。如果先轉成圖片,就需要選擇顏色、尺度與轉換規則。當時沒有找到能公平保留原始特徵的方式,因此我回到數值特徵與製程知識,建立判讀流程。

已落地與持續研究

既有方案結合統計特徵與製程規則。目前持續研究隨機森林,在特徵工程與實驗之間調整,希望進一步提升判讀準確度。

STDF / 讓新系統正確接手

以 Python 開源轉檔方案為基礎,客製化擷取所需欄位,再使用 Cython 改善大量資料的處理效能。

原系統約 600 萬元/年

STDF:缺失值、量測旗標與系統交付
STDF:缺失值、量測旗標與系統交付

原系統年度維運成本約 600 萬元,提供系統替代決策的成本基準。

看起來缺失,不一定真的缺失

新舊系統比對時,一個沒有數值的欄位,可能代表缺失,也可能是量測故障。需要交叉檢查相關欄位與狀態 flag,才能確認真正的意思。

把驗證放進交付

在確認輸出差異與資料語意後,讓替代系統接手既有流程。截至這次專案整理,系統已上線半年,尚未需要修改或進版。

這個專案讓我學到,轉出資料只是第一步,後續系統能正確理解資料,才是完成交付。

企業 AI Agent / 把模型接進工作流程

讓使用者描述需求,由模型撰寫 SQL,透過 MCP 資料庫工具執行,再根據實際查詢結果整理回覆。

約 80 人次/日

企業 AI Agent:MCP 查詢與上線成果
企業 AI Agent:MCP 查詢與上線成果

每日使用人次由系統直接統計,反映工具在實際工作流程中的使用。

我的工作

獨立完成架構設計、MCP 工具、資料整合與正式上線。模型推論使用閉源服務,工具端提供安全的資料庫操作。

從對話到執行

這個專案的重點,是把模型的回答接到真實資料與可執行工具。工程工作包含釐清資料需求、設計工具介面,以及讓各個部分在實際流程中連接起來。

這項正式上線的系統,完整展示我從資料工具、功能設計到交付的工程能力。

TTT-Discover 用於 Alpha 挖掘

個人實作與探索 · 單卡 TTT-Discover Alpha 挖掘

TTT-Discover:單卡實作與實驗比較
TTT-Discover:單卡實作與實驗比較

我把 TTT-Discover 的想法落在一張 RTX 4090 上:讓模型提出因子方向、生成程式、完成評估,再用結果更新 LoRA,進入下一輪探索。從程式設計到量測與驗證,這段個人實驗由我自行完成。

把閉環搬到本地

我以本地 Qwen2.5-Coder-7B-Instruct 產碼,沿用既有搜尋與評分框架,把註解掉的 train step 打開,接上後續 LoRA 更新。40 輪實驗的軌跡、日誌與候選結果都留有紀錄,讓研究可以從每一輪接續。

一張卡,同時容納生成與更新

生成和訓練若各自載入模型,記憶體預算會很快用完。我改用同一份 base 權重與 LoRA adapter,在階段間共用模型。4-bit 組態的 PyTorch allocated memory 峰值由 18.82 降至 13.63 GiB,減少 5.19 GiB,讓閉環有足夠空間持續運作。

一次處理一批想法

固定 16 個 idea,使用 vLLM 比較併發 1、4、8、16。產碼、驗證與評分的整批完成時間中位數由 39.52 秒降至 5.34 秒,在這段工作流程中加速約 7.4 倍。

讓候選經得起檢查

產碼後我檢查退化因子,再取 top-K 做 walk-forward 驗證,以樣本外 Sharpe 重新排序。每批有 7~8 個候選通過基本檢查且沒有退化。速度、記憶體與因子品質都分開留下實驗證據,幫助我決定下一步要優化什麼。

記憶體數字為 PyTorch allocated 峰值;7.4 倍對應固定 16 個 idea 的產碼、驗證與評分批次量測。

WorldQuant / 24/7 Agent Alpha 挖掘

WorldQuant · 台灣區第四名

WorldQuant:24/7 Agent 與樹狀研究記憶
WorldQuant:24/7 Agent 與樹狀研究記憶

24,072 次回測 · 44 個已提交 Alpha

我建立一套 24/7 運作的 Agent Alpha 自動挖掘系統,把研究方向、候選產生、WorldQuant BRAIN 回測、結果檢查與下一輪決策接成連續流程。成果不只是一批因子,而是一套能持續研究、能留下記憶的系統。

從假說開始,而不是只堆表達式

每個研究方向先有一個經濟假說,說明訊號想捕捉什麼。Agent 再沿著方向提出變體、生成 Alpha expression,將候選送入 BRAIN 回測,取得績效與檢查結果。表達式、設定與結果連在一起保存,後續可以重看每一步為何成立。

24/7 自動挖掘流程

系統持續讀取前一輪狀態、挑選值得延伸的方向、產生候選、執行回測並寫回結果。需要等待的檢查會進入佇列,結果回來後再更新研究紀錄。這樣我能把人工時間用在設定研究問題與判斷方向,重複的生成和量測交給 Agent 接續執行。

樹狀記憶:一個方向,一棵研究樹

研究樹的 root 保存最初的假說;每個 node 保存它相對父節點改了什麼、為何改動、用了什麼 expression 與設定,以及回測後的 Sharpe、fitness、檢查和分支狀態。向下是加深同一個假說,橫向是測試不同變體。若某條分支走不通,系統仍保留紀錄,回到上層試新的 sibling,不會忘記已走過的路。

讓結果回饋下一步

我依回測與檢查結果,更新節點統計和每棵樹的最佳節點,再挑選下一個延伸點。研究不再靠零散筆記記住「哪個分數好」,而是能追溯從假說到候選、從候選到結果的完整脈絡。這套流程支撐了 24,072 次回測、44 個已提交 Alpha,並取得 WorldQuant 台灣區第四名。

此系統使用 Agent、工具與研究樹串接 BRAIN 平台;與 TTT-Discover 的模型訓練閉環為兩個獨立實作。

台灣康寧 / 產線數位化

回溯時間 −99% · 實習競賽第二名

Corning Taiwan summer intern team photo
2023 / CORNING TAIWAN · SUMMER INTERN TEAM

2023 年暑期實習,從零建置 Python / SQL 資料回溯介面,協助工程師快速定位產線問題。

先理解現場怎麼找問題

透過訪談釐清工程師查資料的路徑,再將分散的資料整理成可查詢的工具。隨使用回饋調整功能,減少資料整理與回溯的等待。

讓工具成為實際成果

專案回溯時間減少約 99%,並獲實習生競賽第二名。這段經驗也成為後續半導體資料系統工作的基礎。

GAT × 強化學習智慧排程

排程完成時間平均 −20%

Scheduling model and benchmark diagram redrawn from master thesis
MASTER THESIS / GAT + D3QN · STATIC ENVIRONMENT RESULTS

在陽明交通大學產學合作研究中,探索圖注意力網路與強化學習於產線排程的應用。

和既有方法放在一起比較

以規則式排程為對照,在多組測試情境中評估整體完成時間。研究實驗顯示平均縮短約 20%,並觀察動態條件下的穩定性。

研究方法要回應現場限制

在共同測試基準下,研究方法呈現平均 20% 的完成時間降幅,讓排程設計能用數據比較與驗證。

RECOGNITION / 把成果留下來

在競賽裡驗證,
也在團隊裡完成。

完整競賽經歷 ↗
2024 / 隊長04

TSMC IT CareerHack

第四名 · 多模態工安影像問答

2026 / 台灣區04

WorldQuant

第四名 · Agent 因子研究

2024 / 隊長10

AI CUP 春季賽

第十名 · Pix2Pix / cGAN 影像生成

20234%

T-Brain 房價預測

前 4% · LightGBM / XGBoost 集成

2023 / 暑期實習02

台灣康寧

第二名 · 產線數位化競賽

也參與 2025 AI CUP 詐騙帳戶預測,以 XGBoost 與 PU Learning 探索不平衡資料問題。