Den Patin 丁丹旭

資深產品工程師/研究者

Ruby、Ruby on Rails、Python、PostgreSQL、Oracle · 語言學與醫療

持有剛續發的三年期臺灣就業金卡:免工作許可,可立即到職 — 詳見希望條件

自傳

我建構正式上線的系統,並從頭到尾自己負責 — 架構、後端、基礎設施、營運 — 涵蓋電信、GIS、企業流程自動化(行政、成本控管、專案管理、招募與到職)、不動產、教育科技、音訊與影像的 AI 分析與生成、語言學與醫療。寫程式之前,我會先弄清楚流程實際怎麼跑,再把它收斂成一份可信任的資料來源與一套明確的流程;不會回本的,我會拒絕。資訊工程與計算語言學的學位,研究也一直與產品並行 — 語音 DSP、統計語言模型、黃金標準測試集評估;目前的重心是語音、語言與醫療資料。

工作經歷

~至今

產品工程師

VOIS — iOS 的 AI 歌唱教練 · 合約,遠端

  • 後端與基礎設施全權負責:API、背景音訊處理、管理工具、部署、監控。
  • 正在建構即時回饋層:以 App 訊號處理核心輸出的逐音符分數與機率訓練精簡模型,使回饋遵循聲樂教學法。
技術
  • Ruby 4
  • Rails 8.1
  • PostgreSQL
  • GoodJob
  • Heroku
  • S3
  • Scout
  • Sentry

後端工程師

StagedByAI — AI 室內虛擬佈置 · 合約,遠端

  • 從零建構完整的後端與基礎設施,含影像生成流程的整合,並支撐產品兩年的成長期。
技術
  • Ruby on Rails
  • PostgreSQL
  • Docker
  • CI/CD

開發負責人/後端工程師

nebenan.de(德國最大的鄰里社群網路)、shyftplan(人力排班)、Rentumo(租屋資訊彙整)· 合約,遠端

  • 三個互不相關領域的後端與架構;帶領最多 8 人的跨職能團隊。
  • 主機成本 −30%、交付速度 ×2:經成本分析後,將舊有單體式系統遷移至 Ruby 3+ / Rails 7–8,並現代化 CI/CD。
  • 數 TB 等級的 PostgreSQL 資料庫,關鍵查詢時間 −90%;透過監控與效能分析,事故處理時間 −40%。
技術
  • Ruby on Rails
  • PostgreSQL
  • Redis
  • Docker
  • CI/CD
  • Sentry
  • Datadog

資深軟體工程師/技術主管

Deutsche Telekom IT Solutions(T-Systems)· 聖彼得堡

  • 12 個內部產品,其中 9 個端到端完成(全部受保密協議約束);帶領最多 8 人的團隊。
  • 設計並負責全公司的員工主檔資料服務:將 SAP、1C 與 Active Directory 的紀錄整合成單一乾淨的資料來源,供 2,500 人組織的 10 個以上下游系統使用。
  • T-Mobile 德國全國行動網路(GSM/GPRS/UMTS/LTE)營運狀態記錄系統的技術主管:全國規模的基礎設施資料與地理空間檢視。
  • 負載最高的儀表板快 10 倍(3 秒 → 300 毫秒),支援 2,500 名以上同時上線的使用者:索引、預存程序(utPLSQL)、查詢重構。
  • 將反覆出現的行政流程轉化為軟體:人力成本預測、室內導航與座位/成本規劃、全國設施 Web GIS、全公司活動預約。
技術
  • Ruby on Rails
  • Oracle
  • PL/SQL
  • APEX
  • MySQL
  • ExtJS
  • OpenLayers
  • Python
  • Bash
  • Jenkins

講師(兼任)

ITMO 大學;聖彼得堡彼得大帝理工大學

  • 教授 Linux、Ruby 與 Ruby on Rails 網頁開發(一班最多 20 人);指導 16 名實習生,其中 60% 後來成為全職工程師。
技術
  • Linux
  • Ruby
  • Ruby on Rails

研究助理

聖彼得堡國立大學語文學研究所

  • 研究計畫「用於判定文本風格特徵與領域的量化語言學參數」:以語料統計進行語域識別。
技術
  • Python
  • NLTK

程式設計師

Other Accents Studio · 聖彼得堡

  • 工作室的網頁應用程式與網站:PHP(CodeIgniter)、JavaScript、jQuery。
技術
  • PHP
  • CodeIgniter
  • JavaScript
  • jQuery

技術文件工程師/翻譯

Nexenta Systems;Systematica;Odnoklassniki · 聖彼得堡

  • 產品文件撰寫、排版與在地化;技術翻譯與在地審校(英語、日語、德語)。
技術
  • Adobe FrameMaker
  • RoboHelp
  • i18n/l10n

專案

~至今

TaiwanCards

臺灣華語的語料庫語言學與發音評分平台;語料庫、模型與評分器皆為獨立作者

  • 斷詞:Kneser–Ney 二元語言模型上的 Viterbi 解碼、EM 重新斷詞、相對熵剪枝;以 510 筆黃金標準測試集評估,採 McNemar 檢定與 F1 的配對 bootstrap。
  • 詞彙關聯:具語境分布平滑的 PPMI 與 logDice;稠密 SVD 詞向量在同一組測試集上評測後捨棄。
  • 發音評分自聲學特徵計算(F0 曲線、VOT、共振峰軌跡),伺服器端處理,不使用雲端語音辨識;複習排程採 FSRS-6。
  • 原始碼:學習應用程式(Apache-2.0)、語料庫處理流程
技術
  • Ruby on Rails
  • PostgreSQL
  • Python
  • Hotwire

~至今

dsprb 與 dtwrb

語音訊號處理的開放原始碼 Ruby 函式庫

  • dsprb:純 Ruby 的語音 DSP — radix-2 FFT、梅爾濾波器組、MFCC、YIN 基頻估測、LPC 共振峰(原始碼)。
  • dtwrb:具 Sakoe–Chiba 限制的動態時間校正,以及變長序列的 DBA 平均(原始碼)。
技術
  • Ruby

~至今

taiwan-corpora

Hugging Face 上的三個臺灣華語公開資料集

技術
  • Python

~至今

DenMed

多語病歷的純本機處理流程;開發中

  • 任何語言的檢驗報告 PDF 與掃描檔 → LOINC 代碼與 SI 單位 → 對照多來源參考區間的長期趨勢圖;僅使用本機模型。
技術
  • Python
  • Ollama
  • ONNX
  • PostgreSQL

研究原型

  • 動脈壓與腦血流速度的交叉頻譜分析 — 同調性、B/M 波相位差、腦血流自動調節指標 — 為波列諾夫神經外科研究所開發,2020 年。
  • 奧塞提亞語主要線上字典 ironau.ru 的搜尋相關性與雙方言排序,2018–2019 年。
  • 以 Prolog 實作的吉爾吉斯語構詞分析器,2017 年。
技術
  • Python
  • SQL
  • Prolog

專長技能

產品
  • 對照實際工作流程檢驗需求
  • 利害關係人溝通
  • 範圍協商
  • 取捨分析
後端
  • Ruby on Rails
  • PostgreSQL
  • Python
  • REST API
  • 背景工作
  • Hotwire
資料
  • 數 TB 等級的查詢最佳化
  • pgvector
  • Oracle PL/SQL
  • Redis
語音與語言
  • 語音 DSP(MFCC、F0、共振峰)
  • 統計語言模型
  • 黃金標準測試集評估(bootstrap、McNemar)
AI 工程
  • RAG 與混合搜尋
  • 結構化輸出與函式呼叫
  • 評估框架
  • 本機推論(Ollama、ONNX)
  • MCP 伺服器
交付
  • Docker
  • Kamal
  • GitHub Actions
  • AWS
  • Heroku
  • RSpec
領導
  • 帶領最多 8 人的團隊
  • 指導 16 名實習生
  • 大學授課

學歷

應用資訊學碩士(計算語言學)

聖彼得堡國立大學

碩士論文:以語料庫規模自動化 Greenberg 的量化類型學 — 在按功能語體分層的匈牙利語、日語與土耳其語 100 萬至 1,200 萬詞語料庫上,計算構詞指數(綜合度、黏著度、後綴化)與語域區辨統計量;先前從 Greenberg(1960)到 Kasevich(2009)的研究皆依賴 100 至 1,000 音節的人工樣本。結論:類型學特徵是語域的屬性,而不僅是語言的屬性;並以已發表的人工計數驗證。

資訊與電腦科學學士

ITMO 大學

學士論文:匈牙利語、土耳其語,以及一種自建、黃金分詞依建構方式即已知的多式綜合語(作為受控測試案例)的自動逐詞注解(萊比錫標注規則);受元音和諧與詞素排列規則約束的規則式構詞切分;自行實作的前饋神經網路(反向傳播)用於消解同形詞綴歧義。2013 年以 Delphi 完成 — 早在 ML 框架讓這件事變得例行之前。

語言能力

著作

學術檔案:Google 學術搜尋 · ORCID 0009-0009-6496-382X

希望條件