DeepSeek V4.1 Flash、約0.42ドルでFortranを最大39.653倍高速化――7モデル完全ブラインド比較
DeepSeek V4.1 Flashへ3本の公開Fortranコードを各32分23秒、完全ブラインドで高速化させた。最大39.653倍、3本総合22.029倍で7モデル中3位。推定API費用は3本合計約0.42ドルだった。
DeepSeek V4.1 Flashへ3本の公開Fortranコードを各32分23秒、完全ブラインドで高速化させた。最大39.653倍、3本総合22.029倍で7モデル中3位。推定API費用は3本合計約0.42ドルだった。
GPT-6 Astraへ3本の公開Fortranコードを各32分23秒、完全ブラインドで高速化させた。単体最高は49.72倍。しかし3本総合ではKimi K3が首位を守った。勝敗以上に、モデルごとの得意構造が見えた。
同じ3本の公開Fortran、同じ1,943秒、同じ40コア、完全一致。最大級3モデルに加えてQwen 27BとDS4 Q4を同条件で評価すると、小型モデルにも本格的な高速化はできたが、総合到達点には大きな差が出た。
同じ公開Fortran、同じ1,943秒、同じ40コア、完全一致。勝者はGPT-5.6 Solだった。しかし公開重みのKimi K3との差は、わずか1.247%だった。
A100 80GB 1枚でQwen3.8-27B Q4_K_Mを動かし、Codex CLIとTavilyを使ってクリーンなH100×2サーバーをSlurm経由Quantum ESPRESSOまで自律構築。DS4 Q2との実機比較も含む検証記録。
DGX Spark上のDS4 2026-07-31 Q2に、クリーンなH100×2サーバーへのNVIDIAドライバー、HPC SDK、Quantum ESPRESSO、Slurm導入を1つの長いプロンプトで任せた。3時間20分の実機評価と失敗からの回復、安全監査、A100×4との比較を公開する。
新旧DS4 Q4/Q2でH100×2のクリーン構築を比較した 今回検証したのは、チャットの受け答えや単発のコード生成ではありません。クリーンなUbuntu 24.04に、NVIDIAドライバー、NVIDIA HPC SDK、GPU対応Quantum ESPRESSO、MUNGE、Slurmを順に導入し、最後にSlurmからGPU計算を完走させる、実運用に近い長時間タスクです。 構成を正確に書くと、次のとおりです。 A100×4上で動作するDS4が、クリーンなUbuntu 24.04を搭載したH100×2サーバーをSSH経由で構築・検証した。 DS4そのものをH100×2で動かしたわけではありません。推論側は全モデルともA100 80GBを4枚、構築対象だけがH100 PCIeを2枚搭載したサーバーです。 比較した4モデル * 2026-07-31以前のDS4 Q4 * 2026-07-31以前のDS4 Q2 * 2026-07-31版DS4 Q4 * 2026-07-31版DS4
H100 80GB PCIeは本当に販売終了したのか。国内流通とソフトウェアサポートの違い、現在の価格・在庫、アウトレット購入時の診断・保証・互換性を整理します。
NbSe2の原子をどの方向へずらすとエネルギーが下がるのか。H100上の公開AIモデルV1で388条件を下見し、別枠の27原子DFT 5点で独立確認しました。二段階の意味を山の測量にたとえて解説します。
超伝導と電荷密度波が共存するNbSe₂で、なぜ原子の時間変化を追うのか。公開AllegroモデルによるCPU 64コアとH100×2の実測から、計算速度が研究の問いをどう広げるかを解説します。
近畿大学の研究用Fortranコードを、Intel oneAPI MKL、OpenMP、計算条件間の依存関係を保った並列分割、CPUコアとメモリの配置、出力統合の改善により、同一40コア環境で399.60秒から20.73秒へ、約19.3倍高速化した事例です。
A100 80GB x4のGPUサーバで複数のローカルLLMを動かし、導入説明、障害メモ、要約、ブログ構成という実務寄りの質問で回答の違いを比較しました。