今日の注目トピック

単一H100・10 RPSで初音声p95 50ms未満。品質とidle costは別評価が必要
TTSInferenceCUDAScheduling

Qwen3-TTS、10 RPSで初音声50ms未満を実測

これは何?Qwen3-TTSは文章と話者指定から音声を生成するmodelで、対話serviceでは最初の音が届くまでの待ち時間と途切れない再生が重要です。

Nari LabsはQwen3-TTS 1.7B CustomVoiceを単一のNVIDIA H100で動かし、10 RPS時の95percentileで最初の音声まで50ms未満、再生中のunderrunなしを報告しました。Talker、Code Predictor、Codecを一つのschedulerで扱い、初音声を優先した後は再生deadlineを守るbatching、CUDA graph、専用Triton kernel、codec state cacheを組み合わせています。約2 dollar per million charactersという試算はfull utilization前提で、network、idle time、運用費や品質比較は含みません。

なぜ重要か

音声AIの体感速度はmodel単体のtoken速度では決まらず、初音声と継続再生をどうscheduleするかに左右されます。導入判断では公開benchmarkの負荷条件を合わせ、latency、underrun、音質、idle costを分けて測る必要があります。

読むべき人
音声AI、real-time inference、GPU serving、対話productの担当者
HN
138 points / 33 comments
同じOCI imageをFirecrackerとApple Virtualization.frameworkで実行。snapshotは非対称
MicroVMApple SiliconFirecrackerRust

Encore、Linux microVM stackをApple Siliconへ移植

これは何?microVMはcontainerより強い隔離を小さな仮想machineで提供し、buildやuntrusted workloadをhostから分離する基盤です。

EncoreはFirecracker専用だったbuild隔離を、LinuxではFirecracker、macOSではApple Virtualization.frameworkで動かす共通API「crackling」へ再構築しました。同じOCI image、guest agent、vsock protocolを保ち、rootfs・kernel・initramfs生成もroot権限不要のRust実装へ移しています。AppleのVM objectは単一queueへ閉じ込める必要があり、第三者がsnapshot保存を使えないため、restore機能にはbackend差が残ります。

なぜ重要か

異なるvirtualization backendの共通化では、APIの形よりthreading、image format、snapshotなどの能力差が境界になります。unsupported featureを明示する契約は、localとCIの環境差を隠さず運用できます。

読むべき人
platform engineer、build infrastructure、sandbox、macOS developer toolingの担当者
HN
143 points / 81 comments
19個の括弧で10.640秒だった不正SQLをpackratで0.001秒に短縮
DuckDBSQLPEGParser

DuckDB 2.0、SQL front-endをPEG parserへ刷新

これは何?DuckDBはlocal fileやdatabaseを分析する組み込み型の列指向databaseで、SQL parserは入力文を後段が処理できる構文木へ変換します。

DuckDB 2.0はPostgreSQL由来のLALR parserを、ordered choiceで文法を表す自前のPEG parserへ置き換えました。1.5 previewでは括弧の繰り返しで指数的backtrackingが起き、19個の不正入力に10.640秒かかりましたが、packrat memoizationで0.001秒へ短縮しています。既存のDuckSQLと後段pipelineを維持しつつ、runtime grammar extension APIもpreview公開しました。

なぜ重要か

parserの置換は互換性と拒否時の最悪計算量を同時に扱う必要があります。補完機能からopt-in、本番標準へ段階導入した経路と、悪性入力を数値で回帰testした点が実装上の手本になります。

読むべき人
database、compiler、language tooling、query engineの開発者
HN
67 points / 6 comments
報告作成は週単位から1日へ短縮。一方でreviewが検証から承認へ変化
AI AdoptionReviewDXTeam

AIで成果物は増えたが、reviewと定着が追いつかなかった

これは何?製造業DXの実践記で、生成AIによる資料・application作成の高速化がteamの理解、review、現場定着へ与えた影響を振り返ります。

著者のいう生産性3倍は一作業の速度ではなく並行テーマ数の増加で、週単位だった報告作成が1日になる一方、整った成果物と作り手の理解が分離しました。上司の「理解できないが正しいと思う」という反応から、reviewが検証ではなく承認へ変わり、3時間で作ったapplicationも1か月使われないなど、開発lead timeと定着lead timeの差が露出しました。対策はmanual配布ではなく実課題を一緒に触る場と、質問しやすい関係の再構築です。

なぜ重要か

AI導入後は成果物の完成度を理解度のproxyにできません。reviewerが根拠を問い直せる仕組み、利用定着の測定、学習時間と心理的安全性まで設計しなければ、局所的な速度向上がteamの検証能力を弱めます。

読むべき人
engineering manager、DX推進、AI導入、technical reviewの担当者
Zenn
423 signal / 5 comments
2系統が全workloadを並行実行。13 camera向け5nm ASICはvendor公称1000 TOPS超
WaymoAutonomous DrivingASICEdge AI

Waymo、冗長化した車載computeと5nm ASICを公開

これは何?Waymo Driverはcameraやlidarのsensor情報から周囲を認識し、走行判断を車内で完結する自動運転systemです。

Waymoは2億mile超の完全自動走行を背景に、8年で車載computeを20倍へ拡張したと説明しました。独立した2つのcompute engineが全workloadを並行実行し、片系故障時も継続する構成で、CPU、GPU、専用acceleratorを組み合わせています。5nmの独自ASICは13台の高解像度cameraをreal time処理し1000 TOPS超としていますが、数値はvendor説明で独立benchmarkではありません。

なぜ重要か

edge AIでは最高throughputより、一件ずつのlatency、熱、振動、液冷、故障時の継続性を同時に満たす必要があります。accelerator評価をTOPSだけでなく、sensor入力量と冗長化costまで含めて見る材料になります。

読むべき人
edge AI、automotive、ASIC、safety-critical systemの担当者
HN
121 points / 67 comments