All authors

Claude Skills by hiyenwong
github.com/hiyenwong9,934 skills5 installs19,223 views
- Arxiv 2604 15145 An Axiomatic Benchmark For Evaluation Of ScientifiAn Axiomatic Benchmark for Evaluation of Scientific Novelty Metrics (arXiv: 2604.15145)Votes: 0GitHub stars: 3
- Arxiv 2605 31483 Benhallueval A Multi Task Hallucination EvaluationBenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali (arXiv: 2605.31483)Votes: 0GitHub stars: 3
- Arxiv 2607 06420 Holocount A Holistic Visual Counting Benchmark ForHoloCount: A Holistic Visual Counting Benchmark for MLLMs (arXiv: 2607.06420)Votes: 0GitHub stars: 3
- Arxiv 2607 20759 Issuetrojanbench Benchmarking Ai Coding Agents AgaIssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests (arXiv: 2607.20759)Votes: 0GitHub stars: 3
- Arxiv 2607 20925 Representing Entity Importance In Ai Knowledge SysRepresenting Entity Importance in AI Knowledge Systems: A Dual-Signal Framework of Audience Evaluati (arXiv: 2607.20925)Votes: 0GitHub stars: 3
- Arxiv 2607 21111 Tour A Trajectory Level Unlearning Benchmark For OTOUR: A Trajectory-Level Unlearning Benchmark for Offline Reinforcement Learning (arXiv: 2607.21111)Votes: 0GitHub stars: 3
- Arxiv 2607 21117 Glucotune A Unified Framework For Blood Glucose PrGlucoTune: A Unified Framework for Blood Glucose Preprocessing, Forecasting, and Benchmarking in Dia (arXiv: 2607.21117)Votes: 0GitHub stars: 3
- Arxiv 2607 21209 Explainability Framework For Policy Aware AutonomoExplainability Framework for Policy-Aware Autonomous Agents (arXiv: 2607.21209)Votes: 0GitHub stars: 3
- Arxiv 2607 21447 Rumba Russian User Memory BenchmarkRUMBA: Russian User Memory Benchmark (arXiv: 2607.21447)Votes: 0GitHub stars: 3
- Arxiv 2607 21550 X 3 Opd Distilling Reasoning Into Large Audio LangX$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment (arXiv: 2607.21550)Votes: 0GitHub stars: 3
- Arxiv 2607 27594 Compliance2lora Personalizable On Demand Safety AlCompliance2LoRA: Personalizable On-Demand Safety Alignment on Arbitrary Policy Subsets via Hypernetwork-Generated LoRA Adapters (arXiv: 2607.27594)Votes: 0GitHub stars: 3
- Arxiv 2607 28609 Osreward Instituting Standardized Evaluation For COSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models (arXiv: 2607.28609)Votes: 0GitHub stars: 3
- Arxiv 2608 00065 H Embedding Harmonizing Global And Token Level RetH+ Embedding: Harmonizing Global and Token-Level Retrieval with Context-Dependent Phrases (arXiv: 2608.00065)Votes: 0GitHub stars: 3
- Arxiv 2608 02616 Openai Privacy Filter A Cross Lingual Cross DomainOpenAI Privacy Filter: A Cross-Lingual, Cross-Domain PII Evaluation Across 32 Benchmarks (arXiv: 2608.02616)Votes: 0GitHub stars: 3
- Arxiv 2608 03228 Saki Score Aware Low Rank Key Indexing With RandomSAKI: Score-Aware Low-Rank Key Indexing with Random-Matrix Noise Correction for KV Retrieval (arXiv: 2608.03228)Votes: 0GitHub stars: 3
- Arxiv 2608 04451 A Counterexample To Fourier Alignment In Single NeA Counterexample to Fourier Alignment in Single-Neuron Modular Addition (arXiv: 2608.04451)Votes: 0GitHub stars: 3
- Arxiv 2608 04479 Audioscape Tta A Structured Soundscape Benchmark FAudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation (arXiv: 2608.04479)Votes: 0GitHub stars: 3
- Arxiv 2608 04519 Leak Resistant Unlearning A New Benchmark For EvalLeak-Resistant Unlearning: A New Benchmark for Evaluating Multi-Hop Reasoning Consistency and Recove (arXiv: 2608.04519)Votes: 0GitHub stars: 3
- Arxiv 2608 04682 Active Swe Benchmarking Coding Agents For ProactivActive-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports (arXiv: 2608.04682)Votes: 0GitHub stars: 3
- Arxiv 2608 04766 Fusep A Multi Center Benchmark For Diverse Tasks IFUSEP: A Multi-Center Benchmark for Diverse Tasks in Early Pregnancy Fetal Ultrasound Screening (arXiv: 2608.04766)Votes: 0GitHub stars: 3
- Arxiv 2608 04783 Repoprobe Benchmarking Architecture Aware RepositoRepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists (arXiv: 2608.04783)Votes: 0GitHub stars: 3
- Arxiv 2608 04830 Contextweave A Real World Workflow BenchmarkContextWeave: A Real-World Workflow Benchmark (arXiv: 2608.04830)Votes: 0GitHub stars: 3
- Arxiv 2608 05086 Item Response Theory For Ai SafetyItem Response Theory for AI Safety (arXiv: 2608.05086)Votes: 0GitHub stars: 3
- Arxiv 2608 05162 Poolbench A Benchmark For Pooling Strategies In CoPoolBench: A Benchmark for Pooling Strategies in Concept Representation Evaluation for Decoder-Only LLMs (arXiv: 2608.05162)Votes: 0GitHub stars: 3
- Arxiv 2608 05171 Beyond Information Retrieval Generative Ai As An EBeyond Information Retrieval: Generative AI as an Epistemic Arbiter to Enhance Collaborative Problem-Solving (arXiv: 2608.05171)Votes: 0GitHub stars: 3
- Arxiv 2608 05196 Ms Mlb An Open Machine Learning Benchmark For BlooMS-MLB: An Open Machine Learning Benchmark for Blood-Based MS Classification (arXiv: 2608.05196)Votes: 0GitHub stars: 3
- Arxiv 2608 05210 Innocent Panels Hateful Stories Evaluating And DetInnocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation (arXiv: 2608.05210)Votes: 0GitHub stars: 3
- Arxiv 2608 05228 Triqua Reconciling Granularity And Context In FactTriQua: Reconciling Granularity and Context in Factuality Evaluation (arXiv: 2608.05228)Votes: 0GitHub stars: 3
- Arxiv 2608 05238 Decoupling Perception From Description ComputationDecoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language (arXiv: 2608.05238)Votes: 0GitHub stars: 3
- Arxiv 2608 05244 A Unified Causal Inference Framework For The DesirA Unified Causal Inference Framework for the Desirability of Outcome Ranking Paradigm in Benefit-Risk Evaluation (arXiv: 2608.05244)Votes: 0GitHub stars: 3
- Arxiv 2608 05246 Lunar Benchmarking Personalized Large Language ModLUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs (arXiv: 2608.05246)Votes: 0GitHub stars: 3
- Arxiv 2608 05265 Evaluating Machine Learning Models For Post WildfiEvaluating Machine Learning Models for Post-Wildfire Debris-Flow Prediction (arXiv: 2608.05265)Votes: 0GitHub stars: 3
- Arxiv 2608 05315 Rectifying Geometric Misalignment Online Source FrRectifying Geometric Misalignment: Online Source-Free Adaptation for Class-Imbalanced EEG (arXiv: 2608.05315)Votes: 0GitHub stars: 3
- Arxiv 2608 05381 C 3 Po Evaluating Cross Modal Composition And CounC$^3$PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models (arXiv: 2608.05381)Votes: 0GitHub stars: 3
- Arxiv 2608 05573 Skilltv Bench Benchmarking How Well Judges PerformSkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution (arXiv: 2608.05573)Votes: 0GitHub stars: 3
- Arxiv 2608 05602 Epistemic Trustworthiness In Generative Ai A NormaEpistemic Trustworthiness in Generative AI: A Normative Framework for Warranted Reliance in High-Stakes Workflows (arXiv: 2608.05602)Votes: 0GitHub stars: 3
- Arxiv 2608 05605 Enhancing Anomaly Resilience In Research NetworksEnhancing Anomaly Resilience in Research Networks: A Large-Scale Forecasting Benchmark for Dynamic Security Baselining (arXiv: 2608.05605)Votes: 0GitHub stars: 3
- Arxiv 2608 05605v1 Enhancing Anomaly Resilience In Research NetworksEnhancing Anomaly Resilience in Research Networks: A Large-Scale Forecasting Benchmark for Dynamic Security Baselining (arXiv: 2608.05605v1)Votes: 0GitHub stars: 3
- Arxiv 2608 05624 Measuring And Detecting Harmful Ai SycophancyMeasuring and Detecting Harmful AI Sycophancy (arXiv: 2608.05624)Votes: 0GitHub stars: 3
- Arxiv 2608 05850 Mameloshnlm Yiddish Language Model And EvaluationMameLoshnLM: Yiddish Language Model and Evaluation Benchmark (arXiv: 2608.05850)Votes: 0GitHub stars: 3
- Arxiv 2608 05850v1 Mameloshnlm Yiddish Language Model And EvaluationMameLoshnLM: Yiddish Language Model and Evaluation Benchmark (arXiv: 2608.05850v1)Votes: 0GitHub stars: 3
- Arxiv 2608 05867 Improving Interoperability Among Defence And NatioImproving Interoperability among Defence and National Security Ontologies: Analysis and Evaluation Tasks (arXiv: 2608.05867)Votes: 0GitHub stars: 3
- Arxiv 2608 05867v1 Improving Interoperability Among Defence And NatioImproving Interoperability among Defence and National Security Ontologies: Analysis and Evaluation Tasks (arXiv: 2608.05867v1)Votes: 0GitHub stars: 3
- Arxiv 2608 05893 Ecg Lens Lead Aware Clinical Context Enriched EcgECG-LENS: Lead-Aware Clinical Context Enriched ECG Report Generation and Evaluation (arXiv: 2608.05893)Votes: 0GitHub stars: 3
- Arxiv 2608 05893v1 Ecg Lens Lead Aware Clinical Context Enriched EcgECG-LENS: Lead-Aware Clinical Context Enriched ECG Report Generation and Evaluation (arXiv: 2608.05893v1)Votes: 0GitHub stars: 3
- Arxiv 2608 05948 Gauge A Measurement Grounded Benchmark For PhysicaGAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models (arXiv: 2608.05948)Votes: 0GitHub stars: 3
- Arxiv 2608 05948v1 Gauge A Measurement Grounded Benchmark For Physica**arXiv ID:** 2608.05948v1 **Authors:** Shuai Wang, Yaxin Feng, Xuekun Jiang, Shihan Tian, Ningyu Yan, Xing Shen, Chaoyang Lyu, Hui Wang, Yunsong Zhou, Hanqing Wang, Jiangmiao Pang, Yang Xiang, Xing Gao, Chunhua Shen, Weinan Zhang **URL:** http://arxiv.org/abs/2608.05948v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 05960 Big Bright Or Invisible A Frozen Feature BenchmarkBig, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models (arXiv: 2608.05960)Votes: 0GitHub stars: 3
- Arxiv 2608 05960v1 Big Bright Or Invisible A Frozen Feature Benchmark**arXiv ID:** 2608.05960v1 **Authors:** Maulik Chevli, Johannes Brandt, Rickmer Braren, Daniel Rueckert, Philip Müller **URL:** http://arxiv.org/abs/2608.05960v1 **Utility Score:** 1.00Votes: 0GitHub stars: 3
- Arxiv 2608 05981 Temporal Bridges For Spatial Resolution EnhancingTemporal Bridges for Spatial Resolution: Enhancing Climate Data Super-Resolution with Bidirectional Alignment (arXiv: 2608.05981)Votes: 0GitHub stars: 3